AI MATH MAP · 2026 · 白雨
← 回到 Blog
NO. 05 · 概念地图 · 深度专题

AI 背后的数学地图。
从 LLM 到 Agent,11 个关键概念。

不是公式列表——是概念地图。这张地图上,4 个 LLM 数学、6 个 Agent 数学、1 个共同基础, 共同构成 AI 工程师每天在做的事:把世界变成数字,在数字里找关系,用关系做判断。 下面是从输入到决策的完整链路,每一步对应一种数学,每个瓶颈对应一组"你必须懂的算法"。

LLM 数学 · 4 件

把世界变成
可计算的数字。

向量(打包)→ 概率(判断)→ 梯度(学习)→ 链式法则(纠错)。LLM 内部只做一件事: 给每个 token 算一个概率分布,挑一个,继续。

输入输出
Agent 数学 · 6 件

让数字系统
演化 + 做决策。

状态(瞬时)+ 状态转移(演化)+ 控制论(纠偏)+ 决策论(选择)+ 信息论(注意力)+ 奖励设计(价值观)。 Agent 不是大模型,是有状态、能纠偏的系统。

状态 + 决策
共同基础 · 1 件

贯穿两层的
思维方式。

数字敏感(用数字描述系统)。不是数学, 但是比数学更重要的"会不会用数学"。

元能力
§ 1

LLM 数学的 4 件:把世界变成可计算的

FOUNDATIONS

这 4 个概念不是按"时间顺序"切,而是按"LLM 如何工作"的链路切——每一步都是下一步的瓶颈。 从输入到输出,LLM 在 4 个数学动作之间循环。

Concept 01
向量
VECTOR

把任何东西变成一串数字。

文字、图像、声音——在送进 LLM 之前,全部先变成向量(一串有顺序的数字)。 "猫"这个词不是字符串,是 [0.23, -0.15, 0.78, ...] 这样 768 个或 4096 个数字。

为什么是数字?因为 LLM 只会算数字。给它图片、给它中文、给它音频, 它都不知道怎么办。给它数字,它就知道怎么算。

直觉
"我"在这个房间里是个坐标(x, y, z)
直觉
一段话的情感是 [积极=0.7, 消极=0.2, 中性=0.1]
含义
所有 AI 输入的第一步 = 变成数字
应用
Embedding 模型把文字转成向量
留下的瓶颈 → 数字有了,但怎么知道两个东西"像不像"?向量之间需要"距离"—— 这是下一个概念要解决的。
Concept 02
概率
PROBABILITY

LLM 的所有输出,都是"押注概率"。

GPT 选下一个字,不是"选那个对的",是"100 个候选里按概率挑"。 "今天天气"的下一个字,候选是"很"(0.4)、"不"(0.3)、"好"(0.2)、其他(0.1)—— LLM 按这个分布抽样。

AI 不是"神",是"一个一直在押宝的赌徒",但每次押注前都告诉你概率。 概率 = "我有多大把握这件事会发生",范围 0~1。

直觉
0.0 = 绝不可能;1.0 = 一定发生
直觉
"明天会下雨吗?" = 0.7(大概率)
应用
Temperature 控制采样随机性
含义
所有 LLM 输出都是概率分布
留下的瓶颈 → 概率告诉 LLM "哪些字可能",但概率不会自己变好。 怎么让模型"学到"更好的概率?——需要梯度。
Concept 03
梯度
GRADIENT

在黑暗里下山——调参几亿次。

LLM 有几十亿个参数(旋钮)。训练 = 调这些旋钮,让"输出误差"最小。 调旋钮的方法叫梯度下降:想象你在黑夜里的大山上,想下到山脚—— 摸脚下,哪边更陡?朝最陡的方向迈一步。重复。

AI 训练不是"编程",是"被磨出来"——像磨刀, 一刀一刀磨到锋利。每调一个旋钮,误差可能减小也可能增大——这就是"梯度"。

直觉
"闭眼下山"——摸脚下哪边最陡,往那走
直觉
每个参数 = 一个旋钮,几十亿个一起调
应用
Loss function + 反向传播
含义
LLM 不是被"设计"的,是被"磨"出来的
留下的瓶颈 → 梯度知道"哪一层错了",但不知道"哪几个旋钮"该负最大责任—— 整个模型有几十亿参数,从误差反推回去需要链式法则。
Concept 04
链式
CHAIN RULE

错了一件事,倒着查谁负最大责任。

神经网络 = 1000 层简单计算叠起来。每层都影响最终输出。 训练时,要"倒着算每一层的贡献"——这就是反向传播,本质是链式法则。

你想知道"今天早餐吃多少影响你今晚睡觉好不好", 但中间有 100 个变量互相影响——链式法则告诉你怎么从最后倒推回去, 看每个变量的"贡献度"。

直觉
错了就返查——"是旋钮 A 还是 B 的锅?"
直觉
复合函数的求导法则
应用
Backpropagation = 链式法则 × 网络结构
含义
深度学习之所以"深",靠这条规则
留下的瓶颈 → LLM 训练完了,但只会"孤立对话"—— 不会跨会话演化、不会主动调工具、不会记住上次犯过的错。 这就到了 Agent 数学。
§ 2

Agent 数学的 6 件:让数字系统演化 + 做决策

BEYOND LLM

LLM 训完了,会"说"——但 Agent 要会"做"。 "做"需要的不只是文字理解,还有状态 + 演化 + 纠偏 + 选择 + 注意力 + 价值观。 这 6 个 Agent 数学,本质上回答一个问题:"系统怎么在不确定的世界里活下来?"

Concept 05
状态
STATE

系统在某一刻的全部信息。

类比:你现在的位置 = (x, y, z, 速度, 朝向)——光知道坐标不够, 要知道速度才算"状态"。Agent 的"状态" = 它现在的所有关键信息。

瞬时 vs 持久:agent 有两种时间尺度的状态——"我现在很专注"(瞬时,秒级) 和"我一直是专注型的人"(持久,年级)。前者是 state,后者是 personality。

直觉
位置 + 速度 = 状态
直觉
"我心情 7/10 + 精力 4/10" = agent 状态
含义
状态是 agent 的"瞬时自我"
应用
StateVector(attention, energy, alertness)
留下的瓶颈 → 状态有了,但下一刻怎么变?——需要状态转移方程。
Concept 06
转移
TRANSITION

已知现在,推下一刻——牛顿力学数字化。

公式:state_{t+1} = f(state_t, action_t, environment_t)。 已知现在的状态、当前动作、环境反馈,推下一时刻的状态。

牛顿第二定律 F = ma 就是状态转移方程——已知现在的位置 + 速度 + 力, 推下一个位置。Agent = 数字化的牛顿力学。

直觉
"我专注了 2 小时"→ 下一刻我"有点累"
直觉
F = ma 就是状态转移方程
应用
EMA(指数移动平均) = 慢变量更新
含义
Agent 的演化 = 状态转移函数反复调用
留下的瓶颈 → 状态会演化,但怎么让它朝我想要的方向演化?——需要控制论。
Concept 07
控制
CONTROL

让系统"想要"到某个状态。

核心:反馈。
① 目标状态:我想让 agent 怎么样
② 观测:我现在在哪
③ 误差:目标 - 观测
④ 控制信号:基于误差,调输入

一个好的 agent,不是"完美一次执行",是"持续朝目标调"。 每一步错就调一步,像自动驾驶的转向。

直觉
水温太低 → 加大火 → 观测 → 再调
直觉
用户说"我没看懂" → agent 重写 → 再问
应用
PID 控制器 / 强化学习反馈环
含义
Agent 不是"神",是"在调的系统"
留下的瓶颈 → 反馈让 agent 朝目标调,但选项那么多,怎么挑?——需要决策论。
Concept 08
决策
DECISION

在不确定下,选期望值最大的。

核心:期望效用最大化——不是"选最好的",是"选期望值最大的"。 A 有 80% 概率赚 100 元,B 有 50% 概率赚 200 元—— 哪个选?答案是"看风险偏好",不是"看 B 大"。

agent 的每个动作 = 一个效用函数的输出,选最大那个。

直觉
买彩票 vs 存银行 = 风险 vs 期望
直觉
A 工具省时间但贵,B 慢但便宜 = 看场景
应用
Multi-armed bandit / Thompson sampling
含义
没有"最优",只有"在你场景下最优"
留下的瓶颈 → 决策后,agent 怎么分配注意力——信息那么多,关注哪个?——需要信息论。
Concept 09
信息
INFORMATION

度量"意外"——决定该注意什么。

核心:熵(Entropy) = H(X) = -∑ p(x) log p(x)。 度量"这件事有多意外"。太阳升起 = 低熵(几乎肯定),股票涨 50% = 高熵(意外)。

agent 的"注意力"本质上是信息论问题—— 该注意什么,就是"哪里意外最大"。

直觉
"天气预报说晴天,实际下大雨" = 高信息
直觉
agent 关注"反常信号"= 熵高的地方
应用
注意力机制 / 异常检测
含义
agent 关注 = 信息论问题,不是玄学
留下的瓶颈 → agent 关注该关注的、做该做的决策——但凭什么"该"和"不该"?谁定义"好"? ——需要奖励设计。
Concept 10
奖励
REWARD

agent 的"价值观"——你教它什么重要。

核心:奖励函数决定 agent 学什么行为。 没有"价值观"的 agent——它的价值观是你通过事件权重教它的。

你今天给 agent 一个 USER_MESSAGE(权重 2.0)、一个 LLM_REFLECT(权重 0.3)—— 它就"学"到用户消息比自反思重要。这就是奖励。

直觉
"妈妈夸你"权重高,"陌生人夸你"权重低 = 价值观
直觉
USER_MESSAGE > TOOL > TIME > AUTO = 优先级表
应用
RLHF / 人类反馈强化学习
含义
agent 的"道德"是你写的,不是天生的
留下的瓶颈 → 11 个数学概念到这里讲完了。但还有一个贯穿一切的东西: 数字敏感——这不在数学里,在用数学的人里。
§ 3

共同基础 1 件:贯穿两层的思维方式

META

LLM 数学 + Agent 数学讲完了——但还有一个贯穿一切的东西: 数字敏感——这不在数学里,在用数学的人里。

Concept 11
数字感
NUMERACY

用数字描述系统——比公式更基础。

你今天看了 6 个事件类型,每个有 weight(0.3-2.0)和 beta(0.2-0.7)。 这些数字不是"拍脑袋"——是"用数字描述世界"的能力。 USER_MESSAGE 温和 (0.3),TASK_FAIL 严重 (0.7)——这是标度设计(scale design)。

大部分数学家不擅长给数字——他们擅长推公式。 真正的工程 = 把"感觉"变成"数字"。

直觉
"这个 bug 很严重" → "严重度 0.7"
直觉
"用户消息重要" → "权重 2.0"
含义
不是数学,是元能力
应用
事件权重表 / 阈值设计 / 评分函数
§ 4

自己试试 — 把概念拖到对应阶段

INTERACTIVE

11 个概念卡可拖拽。拖到下方的 LLM 数学 / Agent 数学 / 共同基础 三个槽位, 看看你分得对不对。分错了也别慌——边界本来就有重叠。

CONCEPT POOL · 拖拽起点
Slot · LLM
LLM 数学
Slot · Agent
Agent 数学
Slot · Common
共同基础
← 回到 Blog

© 2026 @RareMetal AI-Share. Built with 11 concepts and 1 cup of tea.