中文

先聚焦再聆听:面向噪声鲁棒大型音频语言模型的即插即用音频增强器

声音 2026-05-26 v3

摘要

大型音频语言模型(LALMs)是一类用于音频理解的基础模型。现有的LALMs在现实世界的嘈杂声学条件下(语音和非语音声音相互干扰)往往会显著退化。虽然噪声感知的微调可以提高鲁棒性,但它需要特定任务的噪声数据和昂贵的重新训练,限制了可扩展性。为了解决这个问题,我们提出了Focus-Then-Listen(FTL),一个即插即用的音频增强器,用于提高LALMs的噪声鲁棒性。具体来说,FTL首先将输入波形分离为语音和非语音,然后应用模态路由器根据用户指令预测目标音频模态(例如,语音)。最后,一个模态感知融合块生成一个任务自适应的增强信号,用于改进下游感知和推理。在多个LALMs和任务上的实验表明,FTL在不同噪声水平下都能提升性能,而无需对LALMs进行微调。

关键词

引用

@article{arxiv.2603.04862,
  title  = {Focus Then Listen: Exploring Plug-and-Play Audio Enhancer for Noise-Robust Large Audio Language Models},
  author = {Han Yin and Yang Xiao and Younghoo Kwon and Ting Dang and Jung-Woo Choi},
  journal= {arXiv preprint arXiv:2603.04862},
  year   = {2026}
}