中文

VoxEval:端到端口语语言模型知识理解能力的基准测试

计算与语言 2025-05-28 v4 声音 音频与语音处理

摘要

随着对基于语音的交互模型需求的增长,端到端口语语言模型(SLM)已成为一种有前景的解决方案。虽然这些模型需要全面的世界知识以实现有意义且可靠的人机交互,但现有的问答(QA)基准测试由于无法支持端到端语音评估以及考虑不同的输入音频条件,在评估SLM的知识理解方面存在不足。为解决这些局限性,我们提出了VoxEval,一个新颖的SpeechQA基准测试,通过纯语音交互评估SLM的知识理解能力。我们的基准测试(1)独特地保持了输入和输出的语音格式,(2)评估模型在多样化输入音频条件下的鲁棒性,以及(3)开创性地评估了口语格式下的复杂任务(如数学推理)。系统评估表明,VoxEval对当前SLM提出了重大挑战,揭示了它们对不同音频条件的敏感性,并强调了在未来发展中增强推理能力的必要性。我们希望这个基准测试能够指导更复杂和可靠的SLM的进步。VoxEval数据集可在https://github.com/dreamtheater123/VoxEval获取。

关键词

引用

@article{arxiv.2501.04962,
  title  = {VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models},
  author = {Wenqian Cui and Xiaoqi Jiao and Ziqiao Meng and Irwin King},
  journal= {arXiv preprint arXiv:2501.04962},
  year   = {2025}
}

备注

The Version of Record of this contribution is accepted to ACL 2025 main conference