AI Agent 学习日志:从大模型到外部化学习
AI Agent 学习日志:从大模型到外部化学习 今晚阅读《深入理解 AI Agent》,重点不是记住某个框架的实现细节,而是建立一个关于 Agent 的整体视角:大模型提供思考能力;上下文提供当下可见的信息;工具让模型能够对外部世界产生行动。 Agent:让 LLM 从“会说”走向“会做” 可以用一个简单公式概括现代 Agent: Agent = LLM + 上下文 + 工具 LLM 像大脑,负责理解意图、推理、规…
AI Agent 学习日志:从大模型到外部化学习
今晚阅读《深入理解 AI Agent》,重点不是记住某个框架的实现细节,而是建立一个关于 Agent 的整体视角:大模型提供思考能力;上下文提供当下可见的信息;工具让模型能够对外部世界产生行动。
Agent:让 LLM 从“会说”走向“会做”
可以用一个简单公式概括现代 Agent:
Agent = LLM + 上下文 + 工具
LLM 像大脑,负责理解意图、推理、规划与判断;上下文像眼睛,决定它当前能看到哪些信息;工具像手脚,使它不再局限于生成文本,而能检索资料、操作文件、调用系统并完成实际任务。
Agent 的典型工作循环是:理解目标、规划步骤、调用工具执行、观察工具返回的结果、验证目标是否达成;如果没有达成,再调整计划继续执行。
Harness 的意义也在于此。模型能力越强,越需要 Harness 把这种能力引导成可靠的任务执行。Harness 负责上下文管理、工具接口、权限与安全边界、验证和纠正机制。
模型能力与 Agent 能力
LLM 不是一棵由无数 if-else 组成的规则树,而是一个拥有大量参数的数学模型。文本会先被切分并编码成向量,模型通过多层计算预测后续最可能出现的内容。
更强的模型意味着更好的“脑力”:它通常更能理解模糊需求和长上下文,更会拆解任务、选择工具、填写调用参数,并在失败后调整策略。但模型再强,也无法替代工具、权限控制、安全约束与结果验证。
思考型模型能进行更长的内部推理和任务分解,接近 Agent 的规划能力;完整 Agent 还必须能获取新信息、调用工具、观察反馈并持续行动。
上下文:Agent 每次决策时的“视野”
书中第 1.1.3 节将一次 LLM 调用的上下文分为五部分:
- 系统提示词:由开发者定义的身份、权限与行为准则,也可注入用户记忆和环境状态。
- 工具定义:可用工具的名称、用途和参数格式。
- 用户消息:用户当前输入,也可包含 RAG 动态检索出的外部知识。
- 模型回复:此前的思考、文本内容和工具调用请求。
- 工具执行结果:工具返回的反馈,是下一步判断的直接依据。
其中,系统提示词和工具定义构成相对稳定的静态前缀;用户消息、模型回复和工具结果会随着任务推进形成动态历史。
书中的消融实验很直观地说明了它们的作用:没有工具定义,Agent 无法行动;没有工具结果,Agent 看不到反馈,可能反复调用同一个工具;去掉此前的思考,前后决策容易矛盾;缺少历史消息,Agent 会像失忆一样重复已完成步骤。
上下文工程的关键,不是把更多内容塞进窗口,而是为当前任务放入最有效的信息、规则、示例、状态和反馈。
RAG:为上下文提供动态知识
RAG 是“检索增强生成”。它先从知识库中检索与问题相关的文档片段,再把这些资料连同问题一起交给模型回答。
因此,RAG 是上下文工程的重要动态信息来源。它让 Agent 能使用私有领域知识和最新资料,而不必重新训练模型。可靠的 RAG 仍依赖高质量原始资料、合理切分、准确检索与重排序,并应在资料不足时允许模型明确说明不确定性。
Agent 的三种学习机制
Agent 的学习不只等于训练模型。书中把它分为三种互补机制:
| 学习机制 | 发生时间 | 核心方式 | 特征 |
|---|---|---|---|
| 后训练 | 训练时 | 修改模型权重 | 持久、通用,但成本高、更新慢 |
| 上下文学习 | 推理时 | 在提示、示例和资料中快速适应 | 即时、灵活,但临时且受上下文窗口限制 |
| 外部化学习 | 运行时 | 将知识和流程沉淀到模型外部 | 持久、可更新、可解释、可验证 |
后训练像系统性学习教材:把通用的解决问题方式固化进模型参数,让模型“本来就会”。
上下文学习像临场查看参考资料:好的上下文能让模型快速匹配并组合已有能力。它并不改变模型参数,更接近基于输入内容的模式匹配与快速适应。
外部化学习像整理笔记、模板和工具:把已经验证过的知识、流程与经验沉淀为知识库、Skill、可执行代码、工具或工作流。模型以后遇到相似问题时,可以检索并遵循这些外部资产,从而更高效、更一致地完成任务。
对“数字员工”的理解
这也解释了数字员工为什么需要业务人员不断沉淀 Skill。写 Skill 并不是直接修改模型参数,而是把人的业务经验外部化为一份可复用的工作说明书:什么场景触发、要收集哪些信息、如何分步骤处理、调用哪些工具、有哪些异常、什么结果才算完成。
当这些 Skill、知识和工具被持续打磨后,数字员工就能接手原本依赖人工经验的标准化工作。高风险、判断模糊或不可逆的环节,则仍应该保留清晰的权限边界、验证机制和人工确认。
今晚的收获
我现在更愿意把 Agent 看作一个被工程化组织起来的行动系统:
后训练把能力写进模型;上下文学习让模型在当下选对并用好能力;外部化学习把经验沉淀在模型之外,供以后可靠复用。
学习 Agent 的重点不必一开始就深入 Transformer 的数学细节,而应优先理解如何组织上下文、提供工具、管理记忆、规划行动、验证结果和控制风险。模型决定能力底座,Agent 工程决定这种能力能否真正稳定地服务于现实任务。