我同事老周,上周干了件傻事。
他花两千多买了张二手显卡,又熬了三个通宵,就为了在自己那台破台式机上跑一个「小模型」。
结果跑起来了,回答一句话要等四十秒。
他媳妇看他盯屏幕那表情,问他是不是欠了网贷。
老周跟我说这事的时候还嘴硬,说等显卡降价就换。我说你先别换,你连这东西为啥慢都没搞明白。

先说清楚,这玩意到底是啥
你平时用的那些AI,都是住在别人家机房里的。
你打字,数据顺着网线跑到人家服务器,人家算完再传回来。快,是因为人家用的是几万块一张的专业卡。
本地部署,说白了就是把这套东西搬进你家。
模型文件下载到你硬盘上,用你自己的显卡算,断网也能用。这就是区别。
好处有三个,都是实打实的。
第一,不花钱。没有按次收费,没有会员到期。
第二,隐私。你让它帮你改简历、写检讨、整理病历,这些字一个都没出门。
第三,随便折腾。想让它扮演谁就扮演谁,没人管你。
坏处也有一个,挺要命:你电脑的配置,直接决定它是聪明还是智障。

硬件这事,别听商家瞎吹
我把门槛按钱分成三档,你自己对号入座。
第一档,能跑,但慢。
显卡显存 8G 就够进门。像 RTX 3060 这种,二手一千出头。能跑 7B 到 8B 的模型,回答速度大概每秒钟十几个字,跟你打字差不多快。
这一档适合干嘛?试水。你想知道这东西长什么样,先用这个。
第二档,舒服,能干正事。
显存 16G 到 24G。RTX 4060Ti 16G,或者二手的 3090。
到这一档,7B 模型跑得飞快,14B 也能塞进去。你可以让它读一整份合同、一整篇论文,不用切成小块喂。
老周要是一开始买这个,他就不用熬夜了。
第三档,别想了。
真想跑 70B 那种大块头,得有 48G 以上显存,或者两张卡拼一起。
这价格够你买台车。普通人跑本地模型,没必要走到这一步。
还有两个东西容易被人忽略。
内存,至少 32G。模型加载先过内存,内存不够,显卡再好也白搭。
硬盘,留出 100G 空间。一个 14B 的模型文件,动辄二三十个G。

步骤就五步,比装游戏还简单
很多人卡在第一步,其实是因为名字太唬人。
第一步,装个工具。
去搜 Ollama,官网下个安装包,双击,下一步下一步。跟你装微信没区别。
第二步,拉模型。
装完打开命令行,敲一行字:ollama run qwen2.5。
回车。它自己开始下载,进度条一直走。这个模型是阿里开源的,中文好,对新手友好。
文件大概四五个G,看你网速,十分钟到半小时。
第三步,试一句话。
下载完它会出现一个提示符,你直接打字就行。
先问它:帮我写个请假条,理由是牙疼。
看它几秒钟蹦出来。出来了,恭喜,你已经跑通了。
第四步,给它个壳。
命令行太丑,普通人用不惯。
再装个东西叫 Open WebUI,或者更简单的 Chatbox。装完打开,界面跟你平时用的AI一模一样,能改字号能换头像。
到这一步,你已经有一个完全属于自己的AI了。
第五步,断网试试。
把网线拔了,再问它一个问题。
它还能答,说明真跑在你自己机器上。这一下挺爽的,有点像小时候第一次自己组装好四驱车。

有个坑,我替你先踩了
老周失败那次,问题出在模型大小上。
他显卡只有 8G,非要去拉一个 32B 的模型。拉下来二十多个G,跑起来一步三喘。
他不是配置不行,是胃口太大。
记住一句话:模型不是越大越好,是越合适越好。
8G 显存,老老实实跑 7B。16G 显存,可以试试 14B。超了,就是拿小马拉大车。
还有个坑是量化版本。
你下载的时候会看到 q4、q8 这种后缀。这是压缩过的版本,体积小、跑得快,代价是脑子稍微笨一点。
新手直接用 q4,别纠结。

说点掏心窝的
本地跑模型这事,最大的价值不是省钱。
是你会突然明白,AI 没那么神秘。
它就是一堆权重数字,住在你硬盘的一个文件夹里。你删了它,它就没了。你不联网,它照样转。
这种「它在我的地盘上」的感觉,用过一次就回不去了。
老周后来听了我的,把那张显卡退了,换了个 16G 的。
现在他每天下班回家,让模型帮他整理工作邮件,顺带写写朋友圈文案。
上礼拜他跟我说,他媳妇现在不怀疑他网贷了,改怀疑他在搞什么高科技。
我说你告诉她,就是装了个软件的事。
