中文

用声音思考:音频思维链赋能大型音频语言模型的多模态推理

计算与语言 2025-09-29 v1 声音

摘要

近期的大型音频语言模型 (LALMs) 在语音翻译和音频问答等各种音频理解任务中表现出色。然而,在复杂声学场景下的挑战性音频推理任务中,它们表现出显著的局限性。这些情况将极大地受益于降噪、声源分离和精确时间对齐等声学工具的使用,但当前的 LALMs 缺乏使用此类工具的途径。为了解决这一局限性,我们引入了 Thinking-with-Sound (TwS),这是一个通过将语言推理与即时音频域分析相结合,为 LALMs 配备 Audio CoT 的框架。与将音频视为静态输入的现有方法不同,TwS 使模型能够主动利用音频信号进行思考,通过多模态推理执行数值分析和数字处理。为了评估该方法,我们构建了 MELD-Hard1k,这是一个通过引入各种声学扰动而创建的新的鲁棒性基准测试。实验表明,最先进的 LALMs 在 MELD-Hard1k 上性能急剧下降,与纯净音频相比,准确率下降超过 50%50\%。TwS 在鲁棒性方面取得了显著提升,证明了其有效性和可扩展性:小模型的绝对准确率提升了 24.73%24.73\%,且对于更大的模型,提升幅度一致扩展至 36.61%36.61\%。我们的研究结果表明,Audio CoT 可以在无需重新训练的情况下显著增强鲁棒性,为开发更鲁棒的音频理解系统开辟了新方向。

关键词

引用

@article{arxiv.2509.21749,
  title  = {Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models},
  author = {Zhen Xiong and Yujun Cai and Zhecheng Li and Junsong Yuan and Yiwei Wang},
  journal= {arXiv preprint arXiv:2509.21749},
  year   = {2025}
}