阶段三:AI Agent¶
目标不是训练基础模型,而是建设可靠的 AI 应用系统:
学习顺序¶
- LLM 应用基础
- 结构化输出
- Tool Calling 可靠性
- RAG 检索链路
- Workflow 与 Agent 边界
- 状态、记忆与恢复
- Agent Eval
- 可观测性、成本与模型路由
- MCP 的位置与边界
- Agent 安全
- 从 Demo 到生产系统
第二遍:理解 Agent 为什么会失败¶
第一遍建立术语和整体轮廓,第二遍按故障链阅读:
- 模型、结构化输出与工具循环:上下文、四层校验、重试分类、副作用和完整诊断案例;
- 工作流、恢复与副作用:Checkpoint、节点边界、人工暂停、Lease、取消和版本升级;
- RAG、Eval 与线上治理:混合检索、权限过滤、失败定位、评测集、发布门禁和线上 Trace。
不要只记框架 API。每学一个机制,都问:它解决哪一种失败?它不能解决什么?
第三遍:用可重复实验验证¶
- 完成 Tool 幂等实验;
- 完成 Agent Eval 实验;
- 完成 可恢复 Agent Workflow;
- 主动制造模型超时、结构错误、进程重启和重复恢复,并保存证据。
学习原则¶
- 先不用框架实现一次模型调用和工具循环;
- 确定性流程优先,不把所有步骤交给模型;
- 模型负责建议,后端负责权限、校验和执行;
- 先建立评测集,再频繁改 Prompt;
- 把失败、成本和人工接管当作正常系统状态。
阶段完成标准¶
- 能解释 LLM 为什么不确定
- 能实现结构化输出与 Tool Calling
- 能判断 RAG、Workflow 和 Agent 的边界
- 能设计 checkpoint、审批和恢复
- 能建立最小 Eval 和失败案例库
- 能解释 Prompt Injection 与过度授权
- 完成 可恢复 Agent Workflow