SightSound-R1:从视觉到音频语言模型的跨模态推理蒸馏
声音
2025-09-22 v1 人工智能
计算与语言
音频与语音处理
摘要
虽然大型音频语言模型(LALM)在音频理解方面已显示出先进性能,但在复杂声景中的推理能力仍落后于大型视觉语言模型(LVM)。相较于视觉领域,一个瓶颈是缺乏大规模链式思维音频数据以教导LALM进行逐步推理。为规克这一数据和模态差距,我们提出SightSound-R1,一种从更强大的LVM教师向较弱的LALM学生在相同的音视频问答(AVQA)数据集上进行跨模态蒸馏的框架。SightSound-R1包含三个核心步骤:(i)测试时扩展生成面向音频的链式思维(CoT),(ii)音频校准验证以过滤幻觉,(iii)采用监督微调(SFT)后跟随群体相对策略优化(GRPO)的蒸馏管道用于LALM学生。结果表明,SightSound-R1在AVQA测试集内外以及在未见的听觉场景和问题中均显著提升了LALM的推理性能,优于预训练和标签级蒸馏基线。因此,我们得出结论,视觉推理可以有效地传递给音频模型并通过丰富的音视频数据进行扩展。
引用
@article{arxiv.2509.15661,
title = {SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models},
author = {Qiaolin Wang and Xilin Jiang and Linyang He and Junkai Wu and Nima Mesgarani},
journal= {arXiv preprint arXiv:2509.15661},
year = {2025}
}