跳转至

28 可观测性、成本与模型路由

难度:中高级|前置:可观测性、Eval|目标:解释一次 Agent 执行为什么慢、贵或失败

Agent Trace

一次任务至少串联:

用户请求
→ Prompt 构造
→ 模型调用
→ Tool 选择
→ Tool 执行
→ 下一轮模型
→ 最终结果

每个 span 记录:

  • task_id / trace_id;
  • 节点与尝试次数;
  • 模型和 Prompt 版本;
  • 输入输出 Token;
  • Tool 名称和参数摘要;
  • 延迟、错误、费用;
  • 安全和权限结果。

不要默认保存完整敏感 Prompt;使用脱敏、摘要和分级访问。

成本公式

粗略拆解:

总成本
= 输入 Token
+ 输出 Token
+ Embedding / Rerank
+ Tool/API
+ 存储和观测
+ 重试浪费

减少成本不只是缩短 Prompt:

  • 减少不必要步骤;
  • 简单任务用小模型;
  • 缓存确定性结果;
  • 摘要历史;
  • 提前规则过滤;
  • 并行只读工具;
  • 避免失败后的盲目重试。

模型路由

按任务风险和难度选择模型:

任务 策略
分类、抽取 小模型 + Schema
普通总结 中等模型
复杂分析 强模型
高风险决策 强模型 + 规则 + 人工

路由本身需要 Eval,不能只按价格决定。

SLO

定义可运营目标:

  • 任务成功率;
  • P95 端到端延迟;
  • 单任务成本;
  • 人工接管率;
  • 工具失败率;
  • 无证据回答率。

自测

  1. 为什么只记录最终回答无法排查 Agent?
  2. 总成本除了 Token 还有什么?
  3. 模型路由为什么需要 Eval?
  4. 完整 Prompt 为什么不应默认长期保存?

完成标准

  • 能设计一条 Agent Trace
  • 能拆解任务成本
  • 能给任务设计模型路由
  • 能定义五个 SLO

下一单元:MCP 的位置与边界