想在本地跑一个 AI Agent,需要多大的机器?

前言

你有没有过这种时刻——对着 AI 助手说了一堆私密的话,然后突然想:这些数据是不是都进了别人的服务器?

本地运行 AI Agent 的概念图

或者更实际一点:你的工作流里有一堆重复操作,想找个 AI 帮你盯着,但每次调用云端 API 都要考虑 token 费用、网络延迟,还有那该死的"服务不可用"。

于是你动了念头:能不能把 AI 完全装进自己的电脑?

这篇文章回答的不是"买哪张显卡"。我想先帮你建立一个更基础的判断框架——算清楚你需要的机器,取决于你想跑什么样的 AI

Agent 不是一个大模型,是一个小团队

很多人对"本地跑 AI"的理解还停留在:下载一个几十 GB 的模型文件,装进显存,完事。

但 2026 年的"AI Agent"已经不是一个大模型了。它是一个小团队

  • 编排模型(主力):负责听懂你的话、规划步骤、做决策——团队里的"项目经理"
  • 工具调用模型(辅助):负责调 API、执行命令、读文件——"执行员工"
  • Embedding 模型(记忆):负责把你的文档变成向量存起来,让 Agent 能"回忆"——"档案管理员"
  • 如果需要看图片、听语音,还要加视觉/语音模型——"审图员"和"接线员"

团队里每个人都要有个工位。在电脑上,工位就是显存。所以"跑一个 Agent"的真实问题是:这个团队一共需要多大的办公室?

先学会算显存

显存需求有个非常简单的公式:

模型权重 = 参数数量 × 每参数字节数

参数数量是模型自带的(比如 Qwen3-32B 就是 320 亿参数),每参数字节数取决于"量化精度":

精度每参数字节质量用途
BF16(原始)2顶配企业级
Q81几乎无损卡够时
Q5_K_M0.65很接近甜点位
Q4_K_M0.5可接受个人部署首选

所以 Qwen3-32B 用 Q4 量化:320 亿 × 0.5 字节 ≈ 18 GB

但这只是模型本身。还要加上 KV cache(模型推理时的"工作记忆")和系统开销(2-4 GB)。上下文越长,KV cache 越大——8K 上下文只占权重 5-15%,128K 上下文可能吃掉跟权重一样多的显存。

一句话:先定模型和上下文长度,再算显存,最后才轮到买卡。顺序反了,大概率白花钱。

单模型显存速查

以下是 2026 年主流开源模型的 Q4 量化显存需求(模型权重 + 基本 KV cache):

模型类型参数量上下文Q4 显存最小推荐卡
Qwen3-8BDense8B128K~6 GB3060 12GB
Qwen3-14BDense14B128K~10 GB16GB 档
Qwen3-30B-A3BMoE30B(3B 激活)128K~18 GB4090 24GB
Qwen3-32BDense32B128K~19 GB4090 24GB
Qwen3-235B-A22BMoE235B(22B 激活)128K~130 GB多卡(旗舰对照)
GLM-4-9BDense9B32K→128K~6 GB3060 12GB
GLM-Z1-9B推理9B32K→128K~6 GB3060 12GB
GLM-4-32B-0414Dense32B32K→128K~18 GB4090 24GB
GLM-Z1-32B-0414推理32B32K→128K~18 GB4090 24GB
MiniMax-M2 / M2.5MoE230B(10B 激活)200K~115 GB2×A100 / 128GB 内存
Llama 3.3 70BDense70B128K~42 GBA6000 48GB
DeepSeek-R1-7BDense7B128K~5 GB3060 12GB
DeepSeek-R1-14BDense14B128K~9 GB16GB 档
bge-m3(embedding)0.57B8K~1 GB任意

几个读表要点

8B 档(~6GB)是入门甜点位:Qwen3-8B、GLM-4-9B、DeepSeek-R1-7B 都在这个区间。3060 12GB 就能跑,Mac 也能带。做简单 Agent(单模型 + 工具调用)够用。

GLM 是"智能体向"的国产代表:GLM-4-32B 和推理版 GLM-Z1-32B 都是智谱专门强化了函数调用、工具链的模型,做 Agent 的适配度比同尺寸通用模型更好。GLM-Z1 是 DeepSeek-R1 的直接对标,但 32B 尺寸更亲民。

32B 档(~18-19GB)是个人 Agent 甜点位:Qwen3-32B、GLM-4-32B 都能跑在 4090 24GB 上。这是"想认真跑本地 Agent"的大多数人的终点。

MoE 的"激活参数"是最大的认知陷阱:Qwen3-30B-A3B 名字带"3B",MiniMax-M2 更是夸张——230B 总参数只激活 10B,看起来"很轻量",但所有专家权重都要常驻显存。MiniMax-M2 的 BF16 原始版要 457GB,3-bit 量化后也要 101GB——个人用户基本跑不动,只能云端 API 或等更强量化版。这类大 MoE 是"旗舰对照",看看就好。

70B 档(~42GB)是专业门槛:Llama 3.3 70B 需要 A6000 48GB 或双卡,多人服务才考虑。

embedding 模型几乎免费:bge-m3 只要 ~1GB,任何配置都能带。

Agent 组合怎么加

一个 Agent 团队通常是 2-4 个模型同时常驻显存。把它们加总就是总需求:

组合编排模型辅助/工具记忆总显存适合
轻量入门8B Q4(6GB)复用编排bge-m3(1GB)~8 GB12-16GB 卡 / Mac Mini
主流个人32B Q4(19GB)8B Q4(6GB)bge-m3(1GB)~27 GB4090 24GB(紧)/ 32GB 卡
进阶多模态32B Q48B + 视觉 7Bbge-m3~40 GB双卡 / A6000 48GB
专业服务70B Q4(42GB)多并发bge-m348 GB+A100 / 双 A6000

这解释了一个很反直觉的现象:为什么很多人买了 4090 还是觉得"不够用"?因为单模型跑 32B 刚好,但一旦跑 Agent 组合(编排 + 工具 + 记忆),24GB 就捉襟见肘了。

三个被低估的瓶颈

显存是主角,但还有三个配角,很多人装完机才后悔:

内存(RAM):模型加载时会经过内存,显存不够时还会"溢出"到内存。内存至少要双倍于模型文件大小,不然加载就崩。

CPU:CPU 负责"读题"(prefill)和调度。弱 CPU 能拖慢 10-30% 的生成速度——显卡再快,CPU 喂不饱也白搭。

磁盘:模型文件几十 GB,从机械盘加载要 60 秒+,NVMe SSD 只要几秒。磁盘决定你的"开机体验"

还有一个常被忽略的:电源。4090 满载 450W,整机至少 850W 电源,双卡要 1200W+。买卡时没人提醒,装完才发现带不动。

四档配置速查

档位预算典型配置能跑什么
入门<1 万3060 12GB / Mac Mini M4 24GB8-14B 单模型,简单 Agent
主流 ⭐1-3 万4090 24GB32B 编排 + embedding,完整个人 Agent
进阶3-8 万双 4090 / A6000 48GB70B Q4 / 多模态 Agent
专业8-20 万+A100 80GB / Mac Studio70B+ 高吞吐,多人 API 服务

结尾:先算需求,再买卡

如果你现在准备下单,记住这个顺序:

先定你的 Agent 要哪些模型 → 算组合显存 → 留 20% 余量 → 再看预算买卡。

别从"买什么显卡"开始。那就像先买了房子再决定家里住几个人——大概率不是太大就是太小。

AI 本地部署最贵的不是显卡,是你算错了需求之后的重来