大型音频语言模型能否忽略多语言干扰?其选择性听觉注意能力的评估
音频与语音处理
2026-05-19 v1
摘要
在多语言干扰下实现稳健的选择性听觉注意对于大型音频语言模型(Large Audio Language Models, LALMs)的可靠部署至关重要。我们引入 MUSA,这是一个受鸭笼式多语言基准启发的基准,用于源导向的口语语言理解和推理。每个项目由一个英文目标对话与一个在英文、西班牙语、韩语或中文中语义合理的干扰项配对,评估模型在 (1) 单声道、(2) 源分离式两阶段和 (3) 端到端鸭笼式场景下在受控信噪比下的表现。评估两个闭源和四个开源 LALMs,我们发现强大的单声道性能并不确保稳健的选择性听觉注意:在严重信噪比下,鸭笼式准确率下降,错误主要由干扰来源混淆所致。此外,分离减少了声学重叠,但仍留下来源归属问题,常常产生自信的错误答案。数据和代码将在发表后公开。
引用
@article{arxiv.2605.17225,
title = {Can Large Audio Language Models Ignore Multilingual Distractors? An Evaluation of Their Selective Auditory Attention Capabilities},
author = {Heejoon Koo},
journal= {arXiv preprint arXiv:2605.17225},
year = {2026}
}
备注
2 figures, 9 tables, and 12 pages total, with 4 pages of main text