CORD:通过加权在-policy 跨模态蒸馏桥接音频-文本推理鸿沟
声音
2026-01-26 v1 人工智能
音频与语音处理
摘要
大型音频语言模型 (LALMs) 受到广泛关注。尽管基于文本-based 大语言模型 (LLMs) 构建,LALMs 仍常出现知识和推理能力下降。我们假设此限制源于当前训练范式未能有效桥接特征表示空间中的声学-语义鸿沟。为此,我们提出 CORD,一种统一的对齐框架,执行在线跨模态自我蒸馏。具体而言,CORD 在统一模型内对齐音频条件推理与其文本条件对应物。借助文本模态作为内部教师,CORD 在音频 rollout 过程中进行多粒度对齐。/token 层面,它采用带重要性加权的 on-policy 逆 KL 发散,以优先处理早期且语义关键 token。/sequence 层面,CORD 引入基于裁判的全局奖励,通过群相对政策优化 (GRPO) 优化完整推理轨迹。跨多个基准的实证结果表明,CORD 在持续增强音频条件推理方面始终如一地有效,且仅用 8 万合成训练样本即可显著缩小音频-文本性能鸿沟,验证了我们基于 on-policy、多层次跨模态对齐方法的有效性与数据高效性。
引用
@article{arxiv.2601.16547,
title = {CORD: Bridging the Audio-Text Reasoning Gap via Weighted On-policy Cross-modal Distillation},
author = {Jing Hu and Danxiang Zhu and Xianlong Luo and Dan Zhang and Shuwei He and Yishu Lei and Haitao Zheng and Shikun Feng and Jingzhou He and Yu Sun and Hua Wu and Haifeng Wang},
journal= {arXiv preprint arXiv:2601.16547},
year = {2026}
}
备注
13 pages, 4 figures