客服 Agent 的质量问题,往往不在最后一句回复里。
一段回答可能流畅而礼貌,接口也正常返回,但处理对象选错了,某个业务条件没有检查,或者问题进入人工环节后没有继续推进。只看对话,很难知道发生了什么;只看接口,又容易把调用成功当成处理完成。
我参与过企业客服 Agent 项目 AgentOne,质量治理是其中的工作重点。围绕这部分实践,我做了一个同名个人版本,将处理标准、运行排查、人工复盘和回归验证等机制串联起来。本文沿用博客名称 ResolveAI,讨论使用模拟业务资料的个人复现,不涉及企业内部实现与客户数据。
先定义什么叫处理到位
知识咨询需要有适用的资料依据,业务查询需要确认对象和状态,异常处理需要推进到相应路径,人工协同需要明确当前由谁继续处理。不同场景不能只用一个“回复正确”概括。
因此,我把场景设计成一组明确要求:客户目标是什么,处理范围到哪里,需要哪些事实,允许哪些动作,以及怎样判断结果。配置版本则把这些要求固定下来,供运行和复盘共同使用。

个人复现的场景页面历史截图:场景用于组织业务目标与配置。
退款超时便于说明这种区别。识别超时之后,需要判断是否已有异常工单;已有工单时继续跟进,没有工单时才在条件满足后创建。这里的处理目标是推进异常流程,而不是退款已经到账。查询、知识咨询与人工协同也有各自的完成条件,退款只是其中一个例子。
把理解、判断与执行分别留下来
客户用自然语言提出问题,业务系统却需要明确的对象、状态和动作。
在个人版本中,模型承担语义理解或结构化提取,服务端提供业务事实,Policy 与 Guard 检查规则和执行条件,工具层记录动作与回执。兼容路径中的模型候选动作同样需要经过执行检查。

运行检查页面历史截图:输入、配置与执行证据分别呈现。
这种拆分使排查可以沿着实际过程展开:诉求是否理解正确,业务对象是否来自可靠来源,规则是否适用,工具是否执行,结果推进到了哪里。
调用成功与业务成功需要分别记录。接口返回成功,只说明接口处理有结果;是否满足客户目标,要继续看业务状态与 Outcome。结果未知时应保留未知,不能用确定语气的回复填补缺失信息。
客户入口和运营入口使用同一套业务依据
运营人员可以先选择场景,查看配置规定的处理路径。客户不应被要求理解场景编号或策略版本。
个人版本的客户模拟入口从有限能力目录提出候选,由服务端校验并绑定明确修订,再进入共享业务执行链路。客户可以自然提问,运营侧仍然能查到本轮选择与配置依据。
两种入口服务不同任务:场景页适合定义和检查预期,客户入口适合观察自然表达怎样进入业务。共用执行链路,可以避免在聊天入口再写一套不同的业务规则。
调查先判断有没有问题
业务出现异常,不等于 Agent 一定处理错误。
例如,退款本身超时,但 Agent 已查到已有异常单并给出跟进信息。业务风险仍值得关注,却不能因此要求 Agent 再创建一张工单。
我把调查结论与运行结果分开:运行记录保存实际过程,人工复盘判断是否存在质量问题。确认问题后进入改进;误报结束这条改进路径,必要时回头检查筛选或评测依据。

调查页面历史截图:运行过程与人工结论各自保留。
调查也不必把所有问题归给模型。缺少业务事实、工具返回异常、规则版本不适用,都可能导致偏差。先确认判断依据,再沿过程定位,才能决定应该修改什么。
让确认的问题进入后续检查
修改一处逻辑以后,需要检查原问题是否解决,也需要考虑相近表达和关联场景。
个人版本将输入、期望结果与配置关联,形成复测资产。原问题与关联场景承担不同检查任务:前者检查问题是否仍然存在,后者观察改动是否影响其他路径。

机制解释图:场景、运行、调查与复测通过对象关联。图中是个人版本的本地结构,不同历史案例需要分别阅读。
发布判断使用关联证据,而不是重新抄写一份通过结论。配置变化时,也要重新检查证据是否仍适用。个人版本提供变更验证与历史记录;企业中的生产发布由实际组织流程决定。
为什么先复现这一段
客服系统包含身份、订单、知识、工具和人工流程等外部依赖。全部展开,会很快把注意力转移到系统接入上。
我选择先把质量治理串成可操作的路径:定义预期、查看运行、判断偏差、沉淀复测、检查变更。模拟资料让同一组业务条件可以反复查看,也使对象和规则之间的关系更容易解释。
个人版本采用单进程与追加式 JSONL 保存记录。多实例并发、跨存储事务和真实业务接入需要相应的基础设施设计;治理对象与责任分工则可以作为继续扩展的基础。
这种取舍也让复现不以页面数量为目标。增加一项能力之前,先问它帮助完成哪个判断,产生的结果由谁使用,能否回到对应运行。
结语
客服 Agent 的质量治理,连接的是业务要求与实际处理之间的距离。
场景定义让正确处理有依据,运行记录让过程可检查,人工复盘决定哪些问题需要改进,复测与版本记录让修改可以持续检查。客户对话和运营工作台分别面向这条链路的两端。
下一次遇到一条看似合理的回复时,可以继续追问:对象对不对,动作发生没有,业务推进到了哪里?