中文

衡量音频对大型音频语言模型正确性影响的后训练方法

音频与语音处理 2026-03-10 v4

摘要

大型音频语言模型(Large Audio Language Models, LALMs)是多模态AI的重要前沿,旨在解决多样化的音频任务。近期,LALMs的后训练受到越来越多关注,因为其相较于基础模型能显著提升性能。虽然单阶段后训练(如强化学习, Reinforcement Learning, RL)已展现出有前景的成果,但多阶段方法(如监督微调, Supervised Fine-Tuning, SFT,随后进行RL)仍显得次优。如何在多个训练阶段合理分配数据以最大化LALM能力,尚未得到充分探索,大规模高质量数据集也缺乏。为此,我们首先提出AudioMCQ,一套全面的音频多选题数据集,包含57.1万样本,包含两种链式思考标注。其次,我们调查了LALMs中常见的零音频贡献现象,即模型仅凭文本信息即可得出正确答案,而未实际处理音频内容。我们提出音频贡献过滤(Audio-Contribution Filtering)方法,将数据划分为弱音频贡献子集和强音频贡献子集。基于上述洞察,我们发展了两种有效的后训练范式:弱到强(Weak-to-Strong,先对弱音频贡献数据进行SFT,再对强音频贡献数据进行RL)和混合到强(Mixed-to-Strong,先对混合音频贡献数据进行SFT,再对强音频贡献数据进行RL)。我们采用AudioMCQ荣获DCASE 2025 Audio-Question-Answering挑战赛第一名。此外,凭借我们的数据集和不同的训练策略,我们在MMAU-test-mini上达到78.2%,在MMAU上达到75.6%,在MMAR上达到67.1%,在MMSU上达到70.7%,树立了新的状态最佳成绩。

关键词

引用

@article{arxiv.2509.21060,
  title  = {Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models},
  author = {Haolin He and Xingjian Du and Renhe Sun and Zheqi Dai and Yujia Xiao and Mingru Yang and Jiayi Zhou and Xiquan Li and Zhengxi Liu and Zining Liang and Chunyat Wu and Qianhua He and Tan Lee and Xie Chen and Wei-Long Zheng and Weiqiang Wang and Mark Plumbley and Jian Liu and Qiuqiang Kong},
  journal= {arXiv preprint arXiv:2509.21060},
  year   = {2026}
}