大模型回答得像不像人,并不等于 Agent 是否完成了任务。对一个真正进入工作流的 AI 产品,我更关心三个层面:结果、过程和边界。
结果不是一个分数
单轮正确率适合测模型,却不足以评价系统。一次客户请求可能包含理解意图、查找政策、调用工具、处理异常和确认结果。任何一环失败,用户看到的都是“没有解决”。
因此,我会把成功定义为:在约束内完成用户目标,并且结果可以被验证。
过程必须留下证据
系统应该记录关键决策、工具调用和失败原因。没有 Trace,就无法区分模型能力不足、上下文缺失还是工具不可用。
从失败案例开始
与其先设计一个漂亮的总分,不如先收集二十个真实失败案例。把它们归类之后,评价指标通常会自然出现。