中文

基于单模态教师的音视频推理迁移

计算机视觉与模式识别 2026-04-21 v1 多媒体 声音

摘要

近期推理模型在文本领域取得了显著进展,但将这些能力迁移到多模态设置(例如,允许对音视频数据进行推理)仍然是一个挑战,部分原因是针对特定多模态组合缺乏高质量推理数据。为此,我们提出AVRT,这是一个新框架,用于从单模态教师模型生成高质量音视频推理轨迹。我们通过针对各自模态专门化的模型分别生成视觉和音频推理轨迹,然后通过LLM融合模型合并所得轨迹。所得多模态轨迹用于监督式微调(SFT)冷启动,以适应目标模型进行音视频推理轨迹,然后在更大规模数据上进行强化学习训练。我们在七个音视频和音频基准测试上进行评估,3B和7B参数模型在相当大小的模型中实现了包括OmniBench和DailyOmni用于音视频推理以及MMAR用于音频-only推理在内的尖端成绩,表明跨模态训练也能转移到单模态任务,并为多模态推理模型建立了新的训练管道。

关键词

引用

@article{arxiv.2604.16617,
  title  = {AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers},
  author = {Edson Araujo and Saurabhchand Bhati and M. Jehanzeb Mirza and Brian Kingsbury and Samuel Thomas and Rogerio Feris and James R. Glass and Hilde Kuehne},
  journal= {arXiv preprint arXiv:2604.16617},
  year   = {2026}
}