前言
你跟 AI 聊天,聊到第 5 轮它就不记得第 1 轮你说过啥了。客服 AI 查了半天资料,结果给你编了一段故事。文档问答 AI 把张三的事说成李四的——明明文档里写得很清楚。
这就是 LLM 的"健忘症"。
一个产品经理做企业内部知识问答 AI,2024 年上基础 RAG,客户做了 100 次问答测试,答非所问、编故事、张冠李戴的情况不少。2026 年他升级到 Agentic RAG,同样测试,出错率明显下降。这中间不是技术换代,是 RAG 自己变了——从"查一次"变成"自己思考+多次查",从"工具"变成"协作的同事"。
Google 2026 年的研究印证了这个变化:Agentic RAG 比 single-pass RAG 在事实性问答上准确率提升 34%,QA benchmark 达到 90.1%。
所以这篇文章不打算讲"怎么做 RAG"(详见上一期《给 LLM 接外部知识,你该走哪条路?》),重点讲两件事:
- 传统 RAG 自己出了什么问题
- 2026 年的 Agentic RAG 是怎么自我革命的
长上下文和微调也会讲到——但不是"另一个选项",而是"和 Agentic RAG 怎么配合"。
一、2024 年的 RAG:为什么"够用但不好用"
你做 AI 应用时,客户让你做个"内部知识问答"。你找了几个 LLM,试了几个 RAG 框架——以为这事很简单,把文档喂给 AI,问啥答啥。然后你发现 AI 在胡说八道。
这就是基础 RAG 的第一个坑。
基础 RAG 的流程一句话讲完:查文档 → 喂给 AI → 回答(详见上一期教程)。听起来天衣无缝,但实际用起来有三个根本问题——
问题 1:检索是一次性的。AI 问完一次就完了,不追问、不推理、不交叉验证。就像你问图书管理员一个问题,他从书架上抽一本书扔给你,爱看看不看拉倒。
问题 2:检索是"字面匹配"。你说"老张的老婆是谁",AI 查不到——因为文档里写的是"张某某的妻子"。"老张的另一半"更查不到。AI 不懂关系,只懂字面。
问题 3:检索只看字,不看图。PDF 里的表格、流程图、扫描件里的公章——AI 看不见。企业 60% 的知识存在图片、表格、扫描件里(数据来源:SegmentFault 2026 年 RAG 技术全景分析)。这部分信息,基础 RAG 直接放弃。
传统 RAG 是"工具"——但 LLM 真正需要的是"协作的同事"。
二、2026 年的 Agentic RAG:RAG 的"自我革命"
传统 RAG 不是失败,是起点。2026 年,RAG 自己进化出了三件大事,合起来叫 Agentic RAG。
革命 1:从"查一次"到"反复查 + 推理 + 行动"
传统 RAG 是一次性检索——问一次,查一次,答一次。Agentic RAG 是多轮检索 + 反思判断 + 工具调用。
比喻:Agentic RAG 像图书管理员读了你问题,先去查索引 → 翻书 → 发现不够,再查另一本 → 综合答案 → 给你。而不是从书架上抽一本书扔给你就走。
三个核心能力:
- 多轮检索:AI 可以多次查,直到凑齐信息
- 反思判断:AI 知道"这个检索结果不够好,我换关键词再查"
- 工具调用:AI 不光查文档,还能调 API、执行代码、操作数据库
这就是从"工具"变成"自主工作的同事"的根本变化。
公开案例:Anthropic 2026 年发布的 Claude Code Agentic RAG demo,展示了 AI 自己规划检索策略——先查哪个库、再查哪个工具、综合得出结论。整个过程不需要人干预。
革命 2:GraphRAG:知识图谱替代纯向量
传统 RAG 是按"字"查——你说什么,我就查什么里面有没有这个词。GraphRAG 是按"关系"查——把知识画成一张图,实体是点,关系是线。
比喻:"老张的老婆是谁"这个问题——传统 RAG 按字面查不到("老婆"这词不在文档里);GraphRAG 通过人际关系图谱查到("老张 -配偶-> 某某")。
适用场景:
- 法律条文关联(条文之间互相引用)
- 政企组织架构(谁是谁的上级)
- 故障链路追溯(故障从 A 传到 B 再传到 C)
公开案例:Microsoft 2025 年开源 GraphRAG 项目,在 GitHub 上获得 1.5 万+ star,是目前最成熟的知识图谱 RAG 框架。
革命 3:多模态 RAG:AI 不光读字
传统 RAG 是文本 RAG——只能处理文字。多模态 RAG 让 AI 能看图、看表、看公式、看扫描件。
企业 60% 的知识存在图片、表格、PDF 扫描件里——这部分信息,文本 RAG 直接放弃。多模态 RAG 把这部分捡回来了。
比喻:以前 AI 是个"文盲",只能读文字;现在 AI 戴了眼镜,能看图、看表、看公式。
一句话总结:Agentic RAG 不是单一技术,是三件事同时发生——检索变聪明(多轮)、关系被结构化(知识图谱)、信息被多模态化(看图看表)。这三件事合起来,才叫 Agentic RAG。
三、和其他路线的"对照":什么时候不选 Agentic RAG
不是所有场景都适合 Agentic RAG。没有"最好",只有"最合适"。
3.1 和"长上下文"的对照
长上下文是另一种思路:给 AI 换个大笔记本。Claude / GPT / Gemini 现在都支持 100K~1M token 的上下文窗口——直接把所有文档塞进去,不用搭 RAG 架构。
| 维度 | 长上下文 | Agentic RAG |
|---|---|---|
| 比喻 | 给员工发一本大字典 | 给员工配一个图书管理员 |
| 适用 | 一次性任务、不搭系统、预算充足 | 搭正式系统、需要可追溯、预算敏感 |
| 缺点 | 贵(按 token 计费)、中间遗忘问题(Lost in the Middle,长上下文中间部分容易被忽略) | 工程复杂度高、需要持续维护索引 |
| 优势 | 简单、直接、不用搭架构 | 可追溯、成本可控、能处理千万级文档 |
选哪个:
- 一次性问答 → 长上下文最简单
- 搭正式系统 + 成本敏感 → Agentic RAG
3.2 和"微调"的对照
微调是另一种思路:给 AI 报个补习班。用特定领域数据继续训练,让 AI 变成"领域专家"。
| 维度 | 微调 | Agentic RAG |
|---|---|---|
| 比喻 | 岗前培训把员工变成专家 | 给专家配一个实时更新的资料库 |
| 适用 | 风格稳定、强合规、领域专精 | 知识高频更新、需要可追溯、不想付重训成本 |
| 缺点 | 贵(训练成本 + 数据成本)、训完就锁死(知识没法动态更新) | 需要工程化部署、检索质量依赖文档预处理 |
| 优势 | 效果稳定、推理快、风格可控 | 知识可动态更新、可追溯、效果依赖最新数据 |
选哪个:
- 风格 / 输出格式要稳定 → 微调
- 知识高频更新 → Agentic RAG
3.3 2026 年的真实组合
不是"选哪个",是"怎么组合"。
产品经理最终选的是"微调定基础能力 + Agentic RAG 补实时知识 + 工具调用做工作流"的组合。
最常见的组合:
- 客服场景:微调(话术风格)+ Agentic RAG(产品知识库)
- 法律 / 医疗 / 金融:微调(领域术语)+ Agentic RAG(法规 / 案例库)+ 工具调用(查外部系统)
- 企业内部知识库:Agentic RAG(主)+ 长上下文(临时补充)
一句话总结:Agentic RAG 不是终点,是新起点——但它已经是 2026 年的事实标准。不选路线,选组合。
写在最后
LLM 健忘不是 bug,是设计——你得给它"补脑子"。2026 年的补法,最值得押注的是 Agentic RAG + 微调 + 工具调用 的组合。
如果你想动手搭一个 RAG 系统,可以看上一期《你听过的 RAG / 长上下文 / 微调,其实都在治 AI 的同一个"健忘症"》——从基础教程开始。