Audio-DeepThinker:面向音频语言模型的渐进式推理感知强化学习
声音
2026-04-21 v1 计算与语言
摘要
大型音频语言模型 (LALM) 在音频理解方面取得了显著进展,但它们主要作为感知-答复系统运行,缺乏明确的推理过程。现有方法要么依赖监督链式推理 (CoT) 微调——受限于训练数据质量,要么依赖基于粗糙奖励的强化学习 (RL)——不直接评估推理质量。结果是生成的推理链常显得结构完整,却缺乏具体的声学 grounding。我们提出 Audio-DeepThinker 框架,其建立在两个核心思想之上。首先,我们引入混合推理相似度奖励,直接监督生成推理链的质量,通过结合 LLM 评估器评估逻辑路径对齐、关键步骤覆盖和分析深度,以及嵌入相似度组件强制执行与参考推理链的语义对齐。其次,我们提出一种渐进式双阶段课程,使高质量 CoT 推理能够通过纯 RL 探索从 instruction-tuned 模型中涌现——该模型本身不具备任何先验链式推理能力。在阶段 1 中,我们采用混合奖励对基础音频问答进行训练,以培育基本推理模式;在阶段 2 中,我们转向具有更大推理多样性的声学挑战边界案例,使用仅 LLM 奖励进行训练。Audio-DeepThinker 在 MMAR (74.0%)、MMAU-test-mini (78.5%) 和 MMSU (77.26%) 上实现了最先进的成绩,并在 Interspeech 2026 Audio Reasoning Challenge (Single Model Track) 中夺得第 1 名。解释性分析进一步揭示,RL 训练主要重塑了上层 MoE 门控机制,推理标记在上层 Transformer 层中逐渐结晶,为音频推理如何通过探索涌现提供了机制性见解。
引用
@article{arxiv.2604.18187,
title = {Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models},
author = {Xiang He and Chenxing Li and Jinting Wang and Yan Rong and Tianxin Xie and Wenfu Wang and Li Liu and Dong Yu},
journal= {arXiv preprint arXiv:2604.18187},
year = {2026}
}