Agent 从 Demo 到生产:标准回答¶
90 秒版本¶
我认为 Agent 生产化的重点不是让模型拥有更多自由,而是把不确定性限制在可控边界内。首先使用结构化输出和 Schema,并在后端继续做业务规则与权限校验;模型只负责选择工具和生成参数,真正执行由后端负责。
对长任务,我会把整体流程设计成持久化状态机,每一步保存 checkpoint、模型与 Prompt 版本、工具输入输出和执行结果。网络重试、服务重启或人工审批后可以恢复;所有有副作用的 Tool 使用稳定 operation_id 和数据库唯一约束保证幂等。
系统还要设置最大步骤、Token、成本、超时和重试上限,高风险操作进入人工审批。可观测性方面记录完整 Trace、延迟、Token、工具错误和任务结果。最后通过固定 Eval 数据集评估工具选择、参数、任务完成率、延迟与成本,确保 Prompt 或模型升级不会造成回退。
追问:为什么不用普通工作流?¶
固定、可枚举和高风险步骤使用普通工作流;只有自然语言理解、开放式分析和动态工具选择使用 Agent。生产系统通常是确定性 Workflow 包裹少量 Agent 节点。
追问:任务恢复会不会重复执行工具?¶
会,因此 checkpoint 只能解决“从哪里继续”,不能自动解决副作用重复。Tool 需要稳定 operation_id、执行记录和唯一约束;恢复时返回已有结果。
追问:如何证明改 Prompt 后变好了?¶
使用版本化 Eval 数据集,分别测结构化成功率、工具选择、参数、任务完成率、延迟和成本;历史失败案例必须加入回归集。