中文

Audio MultiChallenge:面向自然人类交互的口语对话系统多轮评估

声音 2025-12-18 v1 计算与语言 机器学习

摘要

端到端(E2E)口语对话系统正逐渐取代基于级联管线的语音人机交互方案,直接处理原始音频而无需中间转录。现有基准主要在合成语音和单轮任务上评估这些模型,留下了在真实情境下的多轮对话能力的探索。我们引入 Audio MultiChallenge,一个开源基准,用于在自然多轮交互模式下评估 E2E 口语对话系统。基于评估推理记忆、指令保留和自我一致性的文本版 MultiChallenge 框架,我们引入新的 Voice Editing 轴,测试对中段语音修正和回溯的鲁棒性。我们进一步将每个轴扩展到音频模态,例如引入 Audio-Cue 挑战,用于推理记忆,需要回想环境声音和语音伴随信号而不仅限于语义内容。我们通过一种混合音频-本地智能体和人类在环管线构建 47 位说话者的 452 场对话,配以 1,712 条实例化评估规范,暴露模型在规模上的故障,同时保留未脚本化人类语音中的自然不完整现象。我们评估了专有和开源模型,发现即使是最前沿的模型在本基准上也表现不佳,Gemini 3 Pro Preview(Thinking)作为我们最高性能的模型,仅 achieving a 54.65% 的通过率。错误分析显示,模型在我们新的轴上最常出错,随着更长的音频上下文,自我一致性会下降。这些故障反映了在自然口语对话中跟踪编辑、音频线索和长程上下文的困难。Audio MultiChallenge 提供了一个可复现的测试台,用来量化这些问题并推动音频原生多轮交互能力的提升。

关键词

引用

@article{arxiv.2512.14865,
  title  = {Audio MultiChallenge: A Multi-Turn Evaluation of Spoken Dialogue Systems on Natural Human Interaction},
  author = {Advait Gosai and Tyler Vuong and Utkarsh Tyagi and Steven Li and Wenjia You and Miheer Bavare and Arda Uçar and Zhongwang Fang and Brian Jang and Bing Liu and Yunzhong He},
  journal= {arXiv preprint arXiv:2512.14865},
  year   = {2025}
}