真实世界客服对话的基准测试与学习
计算与语言
2026-05-26 v3
摘要
现有的工业智能客服(ICS)基准和训练流程与真实世界的对话需求仍存在偏差,过度强调可验证的任务成功,而低估了主观服务质量和现实的失败模式,导致离线收益与可部署的对话行为之间存在差距。我们通过一个从基准测试到优化的循环来弥合这一差距:首先,我们引入OlaBench,一个涵盖检索增强生成、基于工作流的系统和智能体设置的ICS基准,评估服务能力、安全性和延迟敏感性;此外,受OlaBench结果显示最先进的LLM仍存在不足的启发,我们提出OlaMind,它从专家对话中提炼可复用的推理模式和服务策略,并应用带有实例级评分标准感知指导的分阶段探索-利用强化学习来提升模型能力。OlaMind在OlaBench上超越了GPT-5.2和Gemini 3 Pro(83.64 vs. 70.58/70.84),并且在在线A/B测试中,与基线相比,平均问题解决率提高了+23.67%,人工转接率降低了-6.6%,将离线收益桥接至部署。OlaBench和OlaMind共同推动ICS系统向更拟人化、更专业和更可靠的部署迈进。项目页面和评估可在 https://olamind-olabench.github.io 获取。
引用
@article{arxiv.2510.22143,
title = {Benchmarking and Learning Real-World Customer Service Dialogue},
author = {Tianhong Gao and Jundong Shen and Jiapeng Wang and Bei Shi and Ying Ju and Junfeng Yao and Huiyu Yu},
journal= {arXiv preprint arXiv:2510.22143},
year = {2026}
}