28 可观测性、成本与模型路由¶
难度:中高级|前置:可观测性、Eval|目标:解释一次 Agent 执行为什么慢、贵或失败
Agent Trace¶
一次任务至少串联:
每个 span 记录:
- task_id / trace_id;
- 节点与尝试次数;
- 模型和 Prompt 版本;
- 输入输出 Token;
- Tool 名称和参数摘要;
- 延迟、错误、费用;
- 安全和权限结果。
不要默认保存完整敏感 Prompt;使用脱敏、摘要和分级访问。
成本公式¶
粗略拆解:
减少成本不只是缩短 Prompt:
- 减少不必要步骤;
- 简单任务用小模型;
- 缓存确定性结果;
- 摘要历史;
- 提前规则过滤;
- 并行只读工具;
- 避免失败后的盲目重试。
模型路由¶
按任务风险和难度选择模型:
| 任务 | 策略 |
|---|---|
| 分类、抽取 | 小模型 + Schema |
| 普通总结 | 中等模型 |
| 复杂分析 | 强模型 |
| 高风险决策 | 强模型 + 规则 + 人工 |
路由本身需要 Eval,不能只按价格决定。
SLO¶
定义可运营目标:
- 任务成功率;
- P95 端到端延迟;
- 单任务成本;
- 人工接管率;
- 工具失败率;
- 无证据回答率。
自测¶
- 为什么只记录最终回答无法排查 Agent?
- 总成本除了 Token 还有什么?
- 模型路由为什么需要 Eval?
- 完整 Prompt 为什么不应默认长期保存?
完成标准¶
- 能设计一条 Agent Trace
- 能拆解任务成本
- 能给任务设计模型路由
- 能定义五个 SLO
下一单元:MCP 的位置与边界