普通知识问答可以用答案正确率评价,但企业智能体往往需要经过多个步骤、调用多个工具并改变业务状态。任何一个环节失败,都可能导致任务没有真正完成。
先定义“任务完成”
评测前要明确任务的起点、结束条件、允许使用的工具和不可违反的规则。例如“完成供应商比价”不只是生成一段建议,还可能包括读取询价数据、统一单位、识别异常报价、输出对比表和提交复核。
建议关注八类指标
- 任务完成率:最终结果是否满足结束条件。
- 结果正确性:计算、引用、字段和业务判断是否准确。
- 工具调用:是否选择了正确工具和参数。
- 过程合规:是否遵守权限、审批和数据范围。
- 异常恢复:接口失败或数据缺失时能否停止、重试或求助。
- 人工接管率:哪些任务需要人介入,介入是否发生在正确节点。
- 效率与成本:完成时间、模型调用和人工投入是否合理。
- 业务结果:是否改善周期、质量、风险或客户体验。
建立分层评测集
基础集覆盖常见任务,边界集覆盖缺失字段和特殊规则,对抗集测试提示注入、越权和敏感信息请求,回归集则保存历史失败样本,防止优化新问题时破坏已有能力。
离线评测不能替代生产监控
真实业务持续变化,制度、系统和数据都可能更新。上线后仍需记录成功率、失败原因、人工修改和用户反馈,并定期把新问题加入回归评测集。