中文

DIFFA-2:面向通用音频理解的实用扩散大语言模型

声音 2026-02-02 v1 计算与语言

摘要

自回归 (AR) 大型音频语言模型 (LALM) 如 Qwen-2.5-Omni 在音频理解和交互方面取得了强大的性能,但在数据和计算资源方面扩张成本高昂,严格的顺序解码限制了推理效率。扩散大语言模型 (dLLM) 最近被证明能有效利用有限训练数据,先前工作表明,用扩散方法取代 AR 主干可在匹配设置下显著提高音频理解能力,尽管规模仍处于概念验证范畴,缺乏大规模指令调优、偏好对齐或实用解码方案。我们提出 DIFFA-2,一个面向通用音频理解的实用扩散 LALM。DIFFA-2 升级了语音编码器,采用双语义和声学适配器,并采用四阶段课程训练,结合语义和声学对齐、大规模监督微调和方差减缓偏好优化,使用完全开源语料库。在 MMSU、MMAU 和 MMAR 上的实验表明,DIFFA-2 在实用训练预算下持续优于 DIFFA,且与强大的 AR LALM 相当,支持扩散建模是大规模音频理解的可行主干。我们的代码可在 https://github.com/NKU-HLT/DIFFA.git 获取。

关键词

引用

@article{arxiv.2601.23161,
  title  = {DIFFA-2: A Practical Diffusion Large Language Model for General Audio Understanding},
  author = {Jiaming Zhou and Xuxin Cheng and Shiwan Zhao and Yuhang Jia and Cao Liu and Ke Zeng and Xunliang Cai and Yong Qin},
  journal= {arXiv preprint arXiv:2601.23161},
  year   = {2026}
}