← 返回文章列表

如何定义 Agent 的成功

正确回答只是起点,真实任务是否闭环才是产品意义上的成功。

大模型回答得像不像人,并不等于 Agent 是否完成了任务。对一个真正进入工作流的 AI 产品,我更关心三个层面:结果、过程和边界。

结果不是一个分数

单轮正确率适合测模型,却不足以评价系统。一次客户请求可能包含理解意图、查找政策、调用工具、处理异常和确认结果。任何一环失败,用户看到的都是“没有解决”。

因此,我会把成功定义为:在约束内完成用户目标,并且结果可以被验证。

过程必须留下证据

系统应该记录关键决策、工具调用和失败原因。没有 Trace,就无法区分模型能力不足、上下文缺失还是工具不可用。

从失败案例开始

与其先设计一个漂亮的总分,不如先收集二十个真实失败案例。把它们归类之后,评价指标通常会自然出现。

← 返回文章列表