AI Agent 工程 · 12
12.1 Eval:用测试集验证客服 Agent
把单元、集成、任务评测与人工审核放进同一客服验收体系。
目标与方法
Eval(系统评测)回答“系统在代表性任务上是否按预期工作”。单元测试查函数;集成测试查工具链;任务评测查订单、拒答、退款边界;人工审核查语气和复杂争议。它不等于模型排行榜。
测试集:正常订单 | 越权 | 退款窗口 | 无证据 | 注入 | 工具故障
→ 预期行为 → 自动断言 + 人工抽样
实践与边界
V5 的 evaluate 对“无权拒答”和“工具故障升级”进行工程断言。通过仅说明模拟控制逻辑通过,不代表真实大模型准确率。验收:新增功能不能让已有拒答或审批测试回归。排查:失败时保存输入、预期和非敏感 trace,不要事后改低断言。
主动回忆:为什么成功率高仍可能掩盖安全拒答失败?
- 必须记:测试集必须覆盖失败路径。
- 建议记:生产还需人工审核抽样。
- 不用记:某次通过率。