EVA-Bench:用于评估语音代理的全新端到端框架
声音
2026-05-29 v2 人工智能
计算与语言
机器学习
摘要
语音代理是人工智能系统,通过口头对话完成任务,正在跨越企业应用的部署。然而,现有基准没有同时解决两个核心评估挑战:生成真实模拟的对话,以及衡量整个语音特定故障模式的质量。我们提出EVA-Bench,一个端到端评估框架,既解决了这两个问题。在模拟方面,EVA-Bench编排机器人之间的音频对话,涉及动态多轮对话,自动模拟验证检测用户模拟器错误,并在计分前适当地重新生成对话。在测量方面,EVA-Bench引入两个复合指标:EVA-A(准确性),捕捉任务完成、忠实性和音频级语音保真度;EVA-X(体验),捕捉对话进展、口语简洁性和轮次时机。两个指标适用于所有主要代理架构, enable direct cross-architecture comparison。EVA-Bench包括213个场景,覆盖三个企业领域,包含受控扰动套件用于方言和噪声鲁棒性,以及pass@1、pass@k、pass^k measurements that distinguish peak from reliable capability. 在覆盖三个架构的12个系统上,我们发现:(1)没有系统在EVA-A pass@1和EVA-X pass@1上同时超过0.5;(2)峰值性能与可靠性能差异显著(EVA-A的median pass@k--pass^k gap为0.44);(3)方言和噪声扰动暴露出显著的鲁棒性差距,影响在不同架构、系统和指标之间变化(mean Δ最高可达0.314)。我们在开源许可下发布完整框架、评估套件和基准数据。
引用
@article{arxiv.2605.13841,
title = {EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents},
author = {Tara Bogavelli and Gabrielle Gauthier Melançon and Katrina Stankiewicz and Oluwanifemi Bamgbose and Fanny Riols and Hoang H. Nguyen and Raghav Mehndiratta and Lindsay Devon Brin and Joseph Marinier and Hari Subramani and Anil Madamala and Sridhar Krishna Nemala and Srinivas Sunkara},
journal= {arXiv preprint arXiv:2605.13841},
year = {2026}
}
备注
Work in progress