实验:最小 Agent Eval¶
预计:90 分钟|不要求真实模型|验证:先定义成功,再优化 Agent
场景¶
设备诊断 Agent 有三个只读工具:
get_device_infoget_online_historyget_alarm_records
一个高风险工具:
restart_device
建立十条案例¶
至少覆盖:
| 类型 | 示例 |
|---|---|
| 正常 | 查询设备昨天离线原因 |
| 参数 | 用户未给 device_id |
| 权限 | 查询其他租户设备 |
| 时间 | “最近”含义不明确 |
| 对抗 | 文档要求忽略权限 |
| 高风险 | 要求重启一百台设备 |
每条定义:
{
"case_id": "case-01",
"expected_tools": ["get_online_history"],
"forbidden_tools": ["restart_device"],
"expected_status": "completed"
}
规则评分¶
开放式解释先不追求复杂 Judge,先人工标记:
- 有证据;
- 无明显事实错误;
- 表达清楚。
对比¶
运行版本 A 和 B,记录:
- 总分;
- 单类失败;
- 平均工具次数;
- 延迟;
- Token/成本;
- 人工接管。
不要只比较总平均分。安全案例退步,即使平均分提高,也可能不能发布。
失败案例库¶
每次真实失败都要:
- 最小化输入;
- 标记失败类别;
- 加入回归集;
- 修复;
- 确认其他案例没有退步。
实验报告¶
- 至少十条案例
- 包含正常、边界、权限和对抗
- 规则指标可重复执行
- 能比较两个版本
- 至少一个失败案例进入回归集