跳到主要内容
返回
← 返回AI Agent 工程:从零到企业应用

AI Agent 工程 · 12

12.1 Eval:用测试集验证客服 Agent

把单元、集成、任务评测与人工审核放进同一客服验收体系。

Eval · 测试 · 回归

目标与方法

Eval(系统评测)回答“系统在代表性任务上是否按预期工作”。单元测试查函数;集成测试查工具链;任务评测查订单、拒答、退款边界;人工审核查语气和复杂争议。它不等于模型排行榜。

测试集:正常订单 | 越权 | 退款窗口 | 无证据 | 注入 | 工具故障
                 → 预期行为 → 自动断言 + 人工抽样

实践与边界

V5 的 evaluate 对“无权拒答”和“工具故障升级”进行工程断言。通过仅说明模拟控制逻辑通过,不代表真实大模型准确率。验收:新增功能不能让已有拒答或审批测试回归。排查:失败时保存输入、预期和非敏感 trace,不要事后改低断言。

主动回忆:为什么成功率高仍可能掩盖安全拒答失败?

  • 必须记:测试集必须覆盖失败路径。
  • 建议记:生产还需人工审核抽样。
  • 不用记:某次通过率。

官方参考(核对日期:2026-09-21)