超越IVR:面向商业合规性的客户支持LLM代理基准测试
计算与语言
2026-01-05 v1
摘要
传统客户支持系统(如交互式语音响应,IVR)依赖僵化脚本,难以应对复杂且受策略驱动的任务。大型语言模型(LLM)代理提供了可行的替代方案,但评估其是否能够遵循商业规则并在真实世界支持工作流程中发挥作用,仍是开放挑战。现有基准主要关注工具使用或任务完成,忽略了代理遵循多步骤政策、导航任务依赖关系以及抵御不可预测用户或环境行为的能力。为此,本文引入JourneyBench,一个旨在评估政策感知代理的基准测试。JourneyBench利用图表示生成多样化且真实的支持情景,提出User Journey Coverage Score(用户旅程覆盖得分)这一新指标,用于衡量政策遵循程度。我们评估了多种最先进的LLM,采用两种代理设计:静态提示代理(SPA)和动态提示代理(DPA),后者显式建模政策控制。基于3个领域的703次对话,我们展示了DPA显著提升了政策遵循,即使是较小的模型如GPT-4o-mini也能超越更强大的GPT-4o。我们的发现表明,结构化编排的重要性,以及JourneyBench作为推动AI驱动客户支持超越IVR时代局限性的关键资源。
关键词
引用
@article{arxiv.2601.00596,
title = {Beyond IVR: Benchmarking Customer Support LLM Agents for Business-Adherence},
author = {Sumanth Balaji and Piyush Mishra and Aashraya Sachdeva and Suraj Agrawal},
journal= {arXiv preprint arXiv:2601.00596},
year = {2026}
}
备注
17 pages, 3 figures, preprint