第11章 自我进化与持续学习
🧬 "普通 Agent 解决任务;自我进化 Agent 解决任务,并学习如何更好地解决下一类任务。"
前面的章节里,我们让 Agent "会用工具、会记忆、会思考、会检索、会训练"。但这些能力大多是静态的:写好的 Prompt 不会自己变好,训练完的模型认知被冻结,今天教会的教训明天可能重犯。
本章聚焦一个贯穿全书的主题——自我进化(Self-Evolution):让 Agent 把每一次交互的副产物(成功模式、失败教训、可迁移技能)沉淀下来,并在后续任务中自动复用与提升。
本章把"自我进化"从浅到深拆成四个层次:
| 节 | 内容 | 核心收获 |
|---|---|---|
| 11.1 | Prompt 自动调优 | 从手工提示词到自动搜索/反思进化:APE、OPRO、DSPy、TextGrad、GEPA |
| 11.2 | Self-Evolution Agent | 自我改进闭环架构、工程落地路径、前沿研究全景、三角色视角与被低估的“总结者” |
| 11.3 | Agentic 数据飞轮 | 轨迹收集→质量过滤→奖励标注→训练迭代的持续自我强化闭环 |
进阶脉络:进化“提示词” → 进化“整个系统行为与前沿能力” → 建立“持续数据飞轮”。从 11.1 的 Prompt 级进化,到 11.2 的系统级闭环与研究前沿,再到 11.3 的工程化持续迭代系统,逐层加深。
开始学习:11.1 Prompt 自动调优