AI Agent 工程课程
首页 › 扩展、生成、评估和改进 Agent

B2 扩展、评估与改进 Agent(模块导读)

这个模块讲什么

模块 B2 回答一个很实际的问题:Agent 不是"写个 Prompt 就能用",它要能被扩展(加记忆、加工具、加能力)、被评估(知道它到底做没做对)、被改进(错了能定位、能修、能安全上线)

官网上这部分高度凝练,每句话都是"结论式断言"。本目录把这些断言拆成"白话 + 类比 + 举例"三件套,让你能照着落地。

模块目标(原文):实现记忆、RAG、Tool、MCP、Skill、Evaluation 与证据驱动改进。

包含哪 10 个场景

  1. B2-1-01 · RAG 管道怎样留下可定位证据 —— 一次错误回答要能逆向穿过"资料准入 → 检索 → 过滤 → 装载 → 引用"整条链,定位错在哪一层。
  2. B2-1-02 · 候选记忆怎样准入、更新和撤回 —— 长期记忆不能模型随手写,必须有主体、来源、准入和撤回的证据。
  3. B2-2-01 · 业务内部能力怎样先协议化 —— 把隐藏在页面里的业务动作,变成有机器可读契约(Tool Contract)的能力。
  4. B2-2-02 · MCP 与异步 Job 怎样接入 Harness —— MCP 解决连接与发现,长任务的可靠性还得靠本地权限、状态和验收。
  5. B2-3-01 · 代码怎样成为 Agent 的元能力 —— 同一段 AI 生成代码,经历"临时计算 → 接口适配 → 候选能力"三种用法,必须隔离和验证。
  6. B2-3-02 · 候选代码怎样成为可召回 Skill —— Skill 是可验证的方法制品,不是 Prompt 模板或单个 Tool,要过完整准入生命周期。
  7. B2-4-01 · Agent Evaluation 的三层结构 —— 评估不是打一个分,而是"环境 → 方法 → 决策"的闭环。
  8. B2-4-02 · 内部完成为什么会被外部验收拒绝 —— 执行链可能稳稳地停在错误结果上,外部验收必须独立存在。
  9. B2-5-01 · 从最终失败回到首次偏离 —— 修复要从第一次偏离开始,而不是在最终输出继续堆 Prompt。
  10. B2-5-02 · 评估怎样驱动灰度、回滚与组织学习 —— 持续改进是受控实验,不是 Agent 自己改写自己。

学完能判断什么

  • 一个 Agent 的"错误"到底该归因到哪一层(事实 / Context / RAG / Tool / 状态 / 模型 / 验收),而不是甩锅给"模型不行"。
  • 什么算"真正完成":内部 checklist 全绿 ≠ 业务成立,必须靠独立的外部验收。
  • 怎么安全地改进:先离线回归、再影子/灰度、再过独立 Gate,最后才沉淀进知识 / Skill / 程序 / 回归集。
  • 什么不能信:模型推断不能当事实、测试全绿不证明未来稳定、平均分提高不证明边界改善。

阅读顺序建议

按单元顺序读即可:B2-1(知识管道)→ B2-2(工具与异步)→ B2-3(代码与 Skill)→ B2-4(评估)→ B2-5(改进闭环)。