不是公式列表——是概念地图。这张地图上,4 个 LLM 数学、6 个 Agent 数学、1 个共同基础, 共同构成 AI 工程师每天在做的事:把世界变成数字,在数字里找关系,用关系做判断。 下面是从输入到决策的完整链路,每一步对应一种数学,每个瓶颈对应一组"你必须懂的算法"。
向量(打包)→ 概率(判断)→ 梯度(学习)→ 链式法则(纠错)。LLM 内部只做一件事: 给每个 token 算一个概率分布,挑一个,继续。
输入输出状态(瞬时)+ 状态转移(演化)+ 控制论(纠偏)+ 决策论(选择)+ 信息论(注意力)+ 奖励设计(价值观)。 Agent 不是大模型,是有状态、能纠偏的系统。
状态 + 决策数字敏感(用数字描述系统)。不是数学, 但是比数学更重要的"会不会用数学"。
元能力这 4 个概念不是按"时间顺序"切,而是按"LLM 如何工作"的链路切——每一步都是下一步的瓶颈。 从输入到输出,LLM 在 4 个数学动作之间循环。
文字、图像、声音——在送进 LLM 之前,全部先变成向量(一串有顺序的数字)。 "猫"这个词不是字符串,是 [0.23, -0.15, 0.78, ...] 这样 768 个或 4096 个数字。
为什么是数字?因为 LLM 只会算数字。给它图片、给它中文、给它音频, 它都不知道怎么办。给它数字,它就知道怎么算。
GPT 选下一个字,不是"选那个对的",是"100 个候选里按概率挑"。 "今天天气"的下一个字,候选是"很"(0.4)、"不"(0.3)、"好"(0.2)、其他(0.1)—— LLM 按这个分布抽样。
AI 不是"神",是"一个一直在押宝的赌徒",但每次押注前都告诉你概率。 概率 = "我有多大把握这件事会发生",范围 0~1。
LLM 有几十亿个参数(旋钮)。训练 = 调这些旋钮,让"输出误差"最小。 调旋钮的方法叫梯度下降:想象你在黑夜里的大山上,想下到山脚—— 摸脚下,哪边更陡?朝最陡的方向迈一步。重复。
AI 训练不是"编程",是"被磨出来"——像磨刀, 一刀一刀磨到锋利。每调一个旋钮,误差可能减小也可能增大——这就是"梯度"。
神经网络 = 1000 层简单计算叠起来。每层都影响最终输出。 训练时,要"倒着算每一层的贡献"——这就是反向传播,本质是链式法则。
你想知道"今天早餐吃多少影响你今晚睡觉好不好", 但中间有 100 个变量互相影响——链式法则告诉你怎么从最后倒推回去, 看每个变量的"贡献度"。
LLM 训完了,会"说"——但 Agent 要会"做"。 "做"需要的不只是文字理解,还有状态 + 演化 + 纠偏 + 选择 + 注意力 + 价值观。 这 6 个 Agent 数学,本质上回答一个问题:"系统怎么在不确定的世界里活下来?"
类比:你现在的位置 = (x, y, z, 速度, 朝向)——光知道坐标不够, 要知道速度才算"状态"。Agent 的"状态" = 它现在的所有关键信息。
瞬时 vs 持久:agent 有两种时间尺度的状态——"我现在很专注"(瞬时,秒级) 和"我一直是专注型的人"(持久,年级)。前者是 state,后者是 personality。
公式:state_{t+1} = f(state_t, action_t, environment_t)。
已知现在的状态、当前动作、环境反馈,推下一时刻的状态。
牛顿第二定律 F = ma 就是状态转移方程——已知现在的位置 + 速度 + 力, 推下一个位置。Agent = 数字化的牛顿力学。
核心:反馈。
① 目标状态:我想让 agent 怎么样
② 观测:我现在在哪
③ 误差:目标 - 观测
④ 控制信号:基于误差,调输入
一个好的 agent,不是"完美一次执行",是"持续朝目标调"。 每一步错就调一步,像自动驾驶的转向。
核心:期望效用最大化——不是"选最好的",是"选期望值最大的"。 A 有 80% 概率赚 100 元,B 有 50% 概率赚 200 元—— 哪个选?答案是"看风险偏好",不是"看 B 大"。
agent 的每个动作 = 一个效用函数的输出,选最大那个。
核心:熵(Entropy) = H(X) = -∑ p(x) log p(x)。
度量"这件事有多意外"。太阳升起 = 低熵(几乎肯定),股票涨 50% = 高熵(意外)。
agent 的"注意力"本质上是信息论问题—— 该注意什么,就是"哪里意外最大"。
核心:奖励函数决定 agent 学什么行为。 没有"价值观"的 agent——它的价值观是你通过事件权重教它的。
你今天给 agent 一个 USER_MESSAGE(权重 2.0)、一个 LLM_REFLECT(权重 0.3)—— 它就"学"到用户消息比自反思重要。这就是奖励。
LLM 数学 + Agent 数学讲完了——但还有一个贯穿一切的东西: 数字敏感——这不在数学里,在用数学的人里。
你今天看了 6 个事件类型,每个有 weight(0.3-2.0)和 beta(0.2-0.7)。 这些数字不是"拍脑袋"——是"用数字描述世界"的能力。 USER_MESSAGE 温和 (0.3),TASK_FAIL 严重 (0.7)——这是标度设计(scale design)。
大部分数学家不擅长给数字——他们擅长推公式。 真正的工程 = 把"感觉"变成"数字"。
11 个概念卡可拖拽。拖到下方的 LLM 数学 / Agent 数学 / 共同基础 三个槽位, 看看你分得对不对。分错了也别慌——边界本来就有重叠。