中文

语音推理能力评估:诊断模态导致的性能差距

音频与语音处理 2025-10-01 v1 多媒体 声音

摘要

我们提出语音推理能力评估 (VERA),这是一种用于评估语音交互系统在实时对话约束下的推理能力的基准测试。VERA 包含 2,931 个语音原生剧集,源自既定文本基准测试,分为五个轨道 (数学、网络、科学、长文本、事实)。每项任务在语音交互中经过调整,同时保持推理难度。VERA 实现文本-语音在模型家族内的直接比较,并支持分析架构选择如何影响可靠性。我们评估了 12 个当代语音系统,以及强文本基线,观察到大规模且持续的模态差距:在竞赛数学中,领先的文本模型达到 74.8% 的准确率,而其语音对等版本仅至 6.1%;在各轨道上平均情况下,最佳文本模型实现 54.0% 的准确率,而语音系统仅至 11.3%。延迟-准确率分析揭示低延迟平台存在准确率平台期,即快速语音系统聚集在约 10% 的准确率附近,而接近文本性能则需要牺牲实时交互。诊断性实验表明,常见的缓解措施不足以应对。增加“思考时间”仅带来微小收益;解耦式级联分离推理与叙述功能虽能提升准确率,但仍远低于文本水平,并引入典型的 grounding/一致性错误。进一步的错误分析显示,原生流式、端到端和级联设计各自呈现出不同的错误特征。VERA 提供了一个可重复的测试平台和针对性诊断工具,为解耦推理与发声的架构提供原则性衡量标准,旨在实现既流畅又可靠的实时语音助理。

关键词

引用

@article{arxiv.2509.26542,
  title  = {Voice Evaluation of Reasoning Ability: Diagnosing the Modality-Induced Performance Gap},
  author = {Yueqian Lin and Zhengmian Hu and Qinsi Wang and Yudong Liu and Hengfan Zhang and Jayakumar Subramanian and Nikos Vlassis and Hai Helen Li and Yiran Chen},
  journal= {arXiv preprint arXiv:2509.26542},
  year   = {2025}
}

备注

Code and data available at https://github.com/linyueqian/VERA