WildSpeech-Bench:真实场景下端到端语音大语言模型的基准测试
计算与语言
2025-09-29 v3
摘要
最近的多模态大语言模型(LLM),如GPT-4o,已展现出强大的直接语音交互能力。然而,缺乏专门且全面的端到端语音LLM评估基准,阻碍了音频LLM在实际应用中优化用户体验。现有的评估方法通常改编自基于文本的基准,忽视了语音的独特特征和挑战,包括韵律、同音词、口吃以及不同的用户期望。在此,我们引入了首个旨在系统评估实际语音对话中端到端语音LLM的全面基准。我们系统地整理了与口语场景相关的真实聊天数据,引入了说话人属性和声学条件的多样性,并增加了语音特定现象的数据集。我们进一步设计了一种查询感知的评估方法,使用定制的评估清单和提示来增强自动评估的准确性。我们对各种主流语音模型进行了全面的测试和详细的分析,揭示了不同语音场景下模型性能的显著差异。查询感知评估的使用进一步实现了在各种语音特定场景下的更细粒度评估。我们的基准可为语音模型的开发和评估提供有价值的见解。
引用
@article{arxiv.2506.21875,
title = {WildSpeech-Bench: Benchmarking End-to-End SpeechLLMs in the Wild},
author = {Linhao Zhang and Jian Zhang and Bokai Lei and Chuhan Wu and Aiwei Liu and Wei Jia and Xiao Zhou},
journal= {arXiv preprint arXiv:2506.21875},
year = {2025}
}