CXMArena:用于评估现实场景下 CXM 性能的统一基准数据集
机器学习
2025-05-20 v2 人工智能
计算与语言
信息检索
摘要
大型语言模型(LLM)在客户体验管理(CXM)中具有巨大的潜力,尤其是在 Contact Center 运营中。然而,由于数据稀缺(因隐私问题)和现有基准测试的局限,评估其在复杂运营环境中的实际效用受到阻碍。现有基准测试往往缺乏现实性,未能融合深入的知识库(KB)集成、真实噪声或对话流利性之外的关键运营任务。为弥合这一差距,我们引入 CXMArena,这是一个新型大规模合成基准数据集,专为评估 CXM 场景中的 AI 而设计。鉴于可能的 Contact Center 功能多样性,我们开发了可扩展的 LLM 驱动管道,模拟构成数据集基础的品牌 CXM 实体——包括包含产品规格、问题分类学和 Contact Center 对话的知识文章。由于受领域专家知识驱动的受控噪声注入和严格的自动化验证,这些实体 closely 代表真实世界分布。基于此,我们发布 CXMArena,提供针对五个重要运营任务的专项基准:知识库细化、意图预测、代理人质量遵从、文章搜索和集成工具的多轮检索增强生成。我们的基线实验强调了基准的难度:即使是最先进的嵌入和生成模型在文章搜索上也仅达到 68% 的准确率,而标准嵌入方法在知识库细化上的 F1 分数仅为 0.3,这凸显了当前模型面临的重大挑战,迫切需要复杂的管道和解决方案来超越传统技术。
引用
@article{arxiv.2505.09436,
title = {CXMArena: Unified Dataset to benchmark performance in realistic CXM Scenarios},
author = {Raghav Garg and Kapil Sharma and Karan Gupta},
journal= {arXiv preprint arXiv:2505.09436},
year = {2025}
}