前言
你有没有过这种时刻——对着 AI 助手说了一堆私密的话,然后突然想:这些数据是不是都进了别人的服务器?

或者更实际一点:你的工作流里有一堆重复操作,想找个 AI 帮你盯着,但每次调用云端 API 都要考虑 token 费用、网络延迟,还有那该死的"服务不可用"。
于是你动了念头:能不能把 AI 完全装进自己的电脑?
这篇文章回答的不是"买哪张显卡"。我想先帮你建立一个更基础的判断框架——算清楚你需要的机器,取决于你想跑什么样的 AI。
Agent 不是一个大模型,是一个小团队
很多人对"本地跑 AI"的理解还停留在:下载一个几十 GB 的模型文件,装进显存,完事。
但 2026 年的"AI Agent"已经不是一个大模型了。它是一个小团队。
- 编排模型(主力):负责听懂你的话、规划步骤、做决策——团队里的"项目经理"
- 工具调用模型(辅助):负责调 API、执行命令、读文件——"执行员工"
- Embedding 模型(记忆):负责把你的文档变成向量存起来,让 Agent 能"回忆"——"档案管理员"
- 如果需要看图片、听语音,还要加视觉/语音模型——"审图员"和"接线员"
团队里每个人都要有个工位。在电脑上,工位就是显存。所以"跑一个 Agent"的真实问题是:这个团队一共需要多大的办公室?
先学会算显存
显存需求有个非常简单的公式:
模型权重 = 参数数量 × 每参数字节数
参数数量是模型自带的(比如 Qwen3-32B 就是 320 亿参数),每参数字节数取决于"量化精度":
| 精度 | 每参数字节 | 质量 | 用途 |
|---|---|---|---|
| BF16(原始) | 2 | 顶配 | 企业级 |
| Q8 | 1 | 几乎无损 | 卡够时 |
| Q5_K_M | 0.65 | 很接近 | 甜点位 |
| Q4_K_M | 0.5 | 可接受 | 个人部署首选 |
所以 Qwen3-32B 用 Q4 量化:320 亿 × 0.5 字节 ≈ 18 GB。
但这只是模型本身。还要加上 KV cache(模型推理时的"工作记忆")和系统开销(2-4 GB)。上下文越长,KV cache 越大——8K 上下文只占权重 5-15%,128K 上下文可能吃掉跟权重一样多的显存。
一句话:先定模型和上下文长度,再算显存,最后才轮到买卡。顺序反了,大概率白花钱。
单模型显存速查
以下是 2026 年主流开源模型的 Q4 量化显存需求(模型权重 + 基本 KV cache):
| 模型 | 类型 | 参数量 | 上下文 | Q4 显存 | 最小推荐卡 |
|---|---|---|---|---|---|
| Qwen3-8B | Dense | 8B | 128K | ~6 GB | 3060 12GB |
| Qwen3-14B | Dense | 14B | 128K | ~10 GB | 16GB 档 |
| Qwen3-30B-A3B | MoE | 30B(3B 激活) | 128K | ~18 GB | 4090 24GB |
| Qwen3-32B | Dense | 32B | 128K | ~19 GB | 4090 24GB |
| Qwen3-235B-A22B | MoE | 235B(22B 激活) | 128K | ~130 GB | 多卡(旗舰对照) |
| GLM-4-9B | Dense | 9B | 32K→128K | ~6 GB | 3060 12GB |
| GLM-Z1-9B | 推理 | 9B | 32K→128K | ~6 GB | 3060 12GB |
| GLM-4-32B-0414 | Dense | 32B | 32K→128K | ~18 GB | 4090 24GB |
| GLM-Z1-32B-0414 | 推理 | 32B | 32K→128K | ~18 GB | 4090 24GB |
| MiniMax-M2 / M2.5 | MoE | 230B(10B 激活) | 200K | ~115 GB | 2×A100 / 128GB 内存 |
| Llama 3.3 70B | Dense | 70B | 128K | ~42 GB | A6000 48GB |
| DeepSeek-R1-7B | Dense | 7B | 128K | ~5 GB | 3060 12GB |
| DeepSeek-R1-14B | Dense | 14B | 128K | ~9 GB | 16GB 档 |
| bge-m3(embedding) | — | 0.57B | 8K | ~1 GB | 任意 |
几个读表要点:
8B 档(~6GB)是入门甜点位:Qwen3-8B、GLM-4-9B、DeepSeek-R1-7B 都在这个区间。3060 12GB 就能跑,Mac 也能带。做简单 Agent(单模型 + 工具调用)够用。
GLM 是"智能体向"的国产代表:GLM-4-32B 和推理版 GLM-Z1-32B 都是智谱专门强化了函数调用、工具链的模型,做 Agent 的适配度比同尺寸通用模型更好。GLM-Z1 是 DeepSeek-R1 的直接对标,但 32B 尺寸更亲民。
32B 档(~18-19GB)是个人 Agent 甜点位:Qwen3-32B、GLM-4-32B 都能跑在 4090 24GB 上。这是"想认真跑本地 Agent"的大多数人的终点。
MoE 的"激活参数"是最大的认知陷阱:Qwen3-30B-A3B 名字带"3B",MiniMax-M2 更是夸张——230B 总参数只激活 10B,看起来"很轻量",但所有专家权重都要常驻显存。MiniMax-M2 的 BF16 原始版要 457GB,3-bit 量化后也要 101GB——个人用户基本跑不动,只能云端 API 或等更强量化版。这类大 MoE 是"旗舰对照",看看就好。
70B 档(~42GB)是专业门槛:Llama 3.3 70B 需要 A6000 48GB 或双卡,多人服务才考虑。
embedding 模型几乎免费:bge-m3 只要 ~1GB,任何配置都能带。
Agent 组合怎么加
一个 Agent 团队通常是 2-4 个模型同时常驻显存。把它们加总就是总需求:
| 组合 | 编排模型 | 辅助/工具 | 记忆 | 总显存 | 适合 |
|---|---|---|---|---|---|
| 轻量入门 | 8B Q4(6GB) | 复用编排 | bge-m3(1GB) | ~8 GB | 12-16GB 卡 / Mac Mini |
| 主流个人 | 32B Q4(19GB) | 8B Q4(6GB) | bge-m3(1GB) | ~27 GB | 4090 24GB(紧)/ 32GB 卡 |
| 进阶多模态 | 32B Q4 | 8B + 视觉 7B | bge-m3 | ~40 GB | 双卡 / A6000 48GB |
| 专业服务 | 70B Q4(42GB) | 多并发 | bge-m3 | 48 GB+ | A100 / 双 A6000 |
这解释了一个很反直觉的现象:为什么很多人买了 4090 还是觉得"不够用"?因为单模型跑 32B 刚好,但一旦跑 Agent 组合(编排 + 工具 + 记忆),24GB 就捉襟见肘了。
三个被低估的瓶颈
显存是主角,但还有三个配角,很多人装完机才后悔:
内存(RAM):模型加载时会经过内存,显存不够时还会"溢出"到内存。内存至少要双倍于模型文件大小,不然加载就崩。
CPU:CPU 负责"读题"(prefill)和调度。弱 CPU 能拖慢 10-30% 的生成速度——显卡再快,CPU 喂不饱也白搭。
磁盘:模型文件几十 GB,从机械盘加载要 60 秒+,NVMe SSD 只要几秒。磁盘决定你的"开机体验"。
还有一个常被忽略的:电源。4090 满载 450W,整机至少 850W 电源,双卡要 1200W+。买卡时没人提醒,装完才发现带不动。
四档配置速查
| 档位 | 预算 | 典型配置 | 能跑什么 |
|---|---|---|---|
| 入门 | <1 万 | 3060 12GB / Mac Mini M4 24GB | 8-14B 单模型,简单 Agent |
| 主流 ⭐ | 1-3 万 | 4090 24GB | 32B 编排 + embedding,完整个人 Agent |
| 进阶 | 3-8 万 | 双 4090 / A6000 48GB | 70B Q4 / 多模态 Agent |
| 专业 | 8-20 万+ | A100 80GB / Mac Studio | 70B+ 高吞吐,多人 API 服务 |
结尾:先算需求,再买卡
如果你现在准备下单,记住这个顺序:
先定你的 Agent 要哪些模型 → 算组合显存 → 留 20% 余量 → 再看预算买卡。
别从"买什么显卡"开始。那就像先买了房子再决定家里住几个人——大概率不是太大就是太小。
AI 本地部署最贵的不是显卡,是你算错了需求之后的重来。