VidBridge-R1:通过中间代理任务桥接基于强化学习的视频理解模型中的问答与描述生成
计算机视觉与模式识别
2025-09-29 v2 人工智能
摘要
"先推理后响应"范式在强化学习的加持下,已在推进多模态大语言模型方面展现出巨大潜力。然而,将其应用于视频领域导致了专门化的模型,这些模型在问答或描述生成任务上表现出色,但难以同时掌握两者。简单地合并这两项任务的奖励信号会导致相互性能下降,我们将其归因于两者对立任务本质之间的冲突。为应对这一挑战,我们提出了一种新颖的训练框架,建立在两个中间代理任务之上:DarkEventInfer,它呈现带有遮蔽事件片段的视频,要求模型基于上下文视频线索推断被遮蔽的内容;以及MixVidQA,它呈现由两个不同片段交错组成的视频序列,挑战模型隔离并推理其中一个,同时忽略另一个。这些代理任务迫使模型同时发展整体的、发散性的理解能力和精确的、收敛性的推理能力。体现这一框架,我们提出了VidBridge-R1,第一个能够有效桥接范式冲突的多功能视频推理模型。大量实验表明,VidBridge-R1在一个模型中同时在问答和描述生成上取得了显著的性能提升,证明了我们的方法在培养更具泛化性和强大的视频理解模型方面的有效性。
引用
@article{arxiv.2506.09079,
title = {VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks},
author = {Xinlong Chen and Yuanxing Zhang and Yushuo Guan and Weihong Lin and Zekun Wang and Bohan Zeng and Yang Shi and Sihan Yang and Qiang Liu and Pengfei Wan and Liang Wang and Tieniu Tan},
journal= {arXiv preprint arXiv:2506.09079},
year = {2025}
}