DIFFA:基于扩散的大型音频语言模型的听说能力
声音
2025-11-11 v3 音频与语音处理
摘要
最新进展表明,大型语言模型(LLM)在文本和多模态领域展现出惊人的能力。与此同时,扩散式语言模型作为自回归范式的有力替代方案,因其改进的可控性、双向上下文建模和稳健的生成能力而日益受到关注。然而,其在音频模态上的应用仍鲜有探索。本文引入了 **DIFFA**,即首个基于扩散的大型音频语言模型,旨在实现spoken language understanding。DIFFA 将冻结的扩散语言模型与轻量级双适配器架构相集成,后者桥接了语音理解与自然语言推理。我们采用两阶段训练流程:首先通过ASR目标对齐语义表征;随后通过由LLM生成的合成音频-标题对学习指令跟随能力。尽管仅使用960小时的ASR数据和127小时的合成指令数据进行训练,DIFFA 在MMSU、MMAU 和 VoiceBench 等主要基准测试上均表现出竞争力,甚至优于数个自回归开源基线模型。我们的实验结果揭示了扩散式语言模型在高效可扩展音频理解方面的潜力,为语音驱动的人工智能开辟了新方向。我们的代码将发布于 https://github.com/NKU-HLT/DIFFA.git。
引用
@article{arxiv.2507.18452,
title = {DIFFA: Large Language Diffusion Models Can Listen and Understand},
author = {Jiaming Zhou and Hongjie Chen and Shiwan Zhao and Jian Kang and Jie Li and Enzhi Wang and Yujie Guo and Haoqin Sun and Hui Wang and Aobo Kong and Yong Qin and Xuelong Li},
journal= {arXiv preprint arXiv:2507.18452},
year = {2025}
}
备注
Accepted by AAAI 2026