RSA-Bench:面向真实场景的音频大模型基准测试
声音
2026-04-21 v2
摘要
尽管音频大模型(ALMs)已在各方面取得显著进展,但其鲁棒性在实际部署时仍显脆弱。现有评估主要依赖合成高斯噪声或简单单源干扰,无法捕捉构成真实物理环境的复杂、多层次声学动力学——即“声学生态学”。为弥合这一生态学差距,我们引入\textbf{RSA-Bench},一个综合性鲁棒基准,旨在通过高保真听觉场景模拟来考验ALLMs。与传统方法不同,我们通过在干净语音信号上自然叠加多样化环境声景——涵盖\textit{牧场}、\textit{极端天气}、\textit{教室}和\textit{户外}等场景——并在不同干扰强度下构建评估样本。通过在从基础感知到复杂推理的六项核心任务上进行评估,本研究揭示了三个宏观层面的见解:\textbf{(I) 感知-认知鸿沟:}在低层次识别任务中,模型保持相对韧性,但在高阶推理任务中会出现\textbf{功能崩溃};\textbf{(II) 场景敏感性:}“类似人声”的干扰(如背景笑声)比机械噪声具有更大的破坏性,挑战了模型的听觉注意力机制;\textbf{(III) 降噪悖论:}标准语音增强往往会加剧性能下降,因为ALLMs对降噪引入的语义失真极其敏感。
引用
@article{arxiv.2601.10384,
title = {RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios},
author = {Yibo Zhang and Liang Lin and Kaiwen Luo and Shilinlu Yan and Jin Wang and Yaoqi Guo and Yitian Chen and Yalan Qin and Zhenhong Zhou and Kun Wang and Li Sun},
journal= {arXiv preprint arXiv:2601.10384},
year = {2026}
}