我同事老周,上周干了件傻事。

他花两千多买了张二手显卡,又熬了三个通宵,就为了在自己那台破台式机上跑一个「小模型」。

结果跑起来了,回答一句话要等四十秒。

他媳妇看他盯屏幕那表情,问他是不是欠了网贷。

老周跟我说这事的时候还嘴硬,说等显卡降价就换。我说你先别换,你连这东西为啥慢都没搞明白。

一台老式台式机
一台老式台式机

先说清楚,这玩意到底是啥

你平时用的那些AI,都是住在别人家机房里的。

你打字,数据顺着网线跑到人家服务器,人家算完再传回来。快,是因为人家用的是几万块一张的专业卡。

本地部署,说白了就是把这套东西搬进你家。

模型文件下载到你硬盘上,用你自己的显卡算,断网也能用。这就是区别。

好处有三个,都是实打实的。

第一,不花钱。没有按次收费,没有会员到期。

第二,隐私。你让它帮你改简历、写检讨、整理病历,这些字一个都没出门。

第三,随便折腾。想让它扮演谁就扮演谁,没人管你。

坏处也有一个,挺要命:你电脑的配置,直接决定它是聪明还是智障。

一根网线从家里延伸到远处的数据中心大楼
一根网线从家里延伸到远处的数据中心大楼

硬件这事,别听商家瞎吹

我把门槛按钱分成三档,你自己对号入座。

第一档,能跑,但慢。

显卡显存 8G 就够进门。像 RTX 3060 这种,二手一千出头。能跑 7B 到 8B 的模型,回答速度大概每秒钟十几个字,跟你打字差不多快。

这一档适合干嘛?试水。你想知道这东西长什么样,先用这个。

第二档,舒服,能干正事。

显存 16G 到 24G。RTX 4060Ti 16G,或者二手的 3090。

到这一档,7B 模型跑得飞快,14B 也能塞进去。你可以让它读一整份合同、一整篇论文,不用切成小块喂。

老周要是一开始买这个,他就不用熬夜了。

第三档,别想了。

真想跑 70B 那种大块头,得有 48G 以上显存,或者两张卡拼一起。

这价格够你买台车。普通人跑本地模型,没必要走到这一步。

还有两个东西容易被人忽略。

内存,至少 32G。模型加载先过内存,内存不够,显卡再好也白搭。

硬盘,留出 100G 空间。一个 14B 的模型文件,动辄二三十个G。

一张显卡插在机箱里
一张显卡插在机箱里

步骤就五步,比装游戏还简单

很多人卡在第一步,其实是因为名字太唬人。

第一步,装个工具。

去搜 Ollama,官网下个安装包,双击,下一步下一步。跟你装微信没区别。

第二步,拉模型。

装完打开命令行,敲一行字:ollama run qwen2.5。

回车。它自己开始下载,进度条一直走。这个模型是阿里开源的,中文好,对新手友好。

文件大概四五个G,看你网速,十分钟到半小时。

第三步,试一句话。

下载完它会出现一个提示符,你直接打字就行。

先问它:帮我写个请假条,理由是牙疼。

看它几秒钟蹦出来。出来了,恭喜,你已经跑通了。

第四步,给它个壳。

命令行太丑,普通人用不惯。

再装个东西叫 Open WebUI,或者更简单的 Chatbox。装完打开,界面跟你平时用的AI一模一样,能改字号能换头像。

到这一步,你已经有一个完全属于自己的AI了。

第五步,断网试试。

把网线拔了,再问它一个问题。

它还能答,说明真跑在你自己机器上。这一下挺爽的,有点像小时候第一次自己组装好四驱车。

一台笔记本屏幕亮着对话框
一台笔记本屏幕亮着对话框

有个坑,我替你先踩了

老周失败那次,问题出在模型大小上。

他显卡只有 8G,非要去拉一个 32B 的模型。拉下来二十多个G,跑起来一步三喘。

他不是配置不行,是胃口太大。

记住一句话:模型不是越大越好,是越合适越好。

8G 显存,老老实实跑 7B。16G 显存,可以试试 14B。超了,就是拿小马拉大车。

还有个坑是量化版本。

你下载的时候会看到 q4、q8 这种后缀。这是压缩过的版本,体积小、跑得快,代价是脑子稍微笨一点。

新手直接用 q4,别纠结。

一个人站在岔路口看路牌
一个人站在岔路口看路牌

说点掏心窝的

本地跑模型这事,最大的价值不是省钱。

是你会突然明白,AI 没那么神秘。

它就是一堆权重数字,住在你硬盘的一个文件夹里。你删了它,它就没了。你不联网,它照样转。

这种「它在我的地盘上」的感觉,用过一次就回不去了。

老周后来听了我的,把那张显卡退了,换了个 16G 的。

现在他每天下班回家,让模型帮他整理工作邮件,顺带写写朋友圈文案。

上礼拜他跟我说,他媳妇现在不怀疑他网贷了,改怀疑他在搞什么高科技。

我说你告诉她,就是装了个软件的事。

夜晚书房的台灯下
夜晚书房的台灯下