中文

ReWatch-R1:通过智能数据合成提升大型视觉语言模型中的复杂视频推理

计算机视觉与模式识别 2025-10-02 v2 人工智能

摘要

虽然基于可验证奖励的强化学习(RLVR)在大型视觉语言模型(LVLMs)中显著推进了图像推理,但其在复杂视频推理方面的应用仍不成熟。这一差距主要源于关键数据瓶颈:现有数据集缺乏具有挑战性的多跳问题和高质量、视频 grounding 的链式思维(Chain-of-Thought, CoT)数据,无法有效引导RLVR。为此,我们引入ReWatch,一个致力于推动高级视频推理的大规模数据集。我们提出一种新型多阶段合成管道,用于合成其三个组成部分:ReWatch-Caption、ReWatch-QA和ReWatch-CoT。核心创新是我们的多智能体ReAct框架,用于CoT合成,模拟人类“重新观看”过程,通过显式建模信息检索与验证,生成与视频相关的推理轨迹。基于该数据集,我们开发ReWatch-R1,通过对强基线LVLM进行监督微调(SFT)和我们的RLVR框架后训练。该框架包含一种新颖的观察与推理(Observation & Reasoning, O&R)奖励机制,评估最终答案的正确性以及推理是否与视频内容一致,直接惩罚幻觉。我们的实验表明,ReWatch-R1在五个具有挑战性的视频推理基准上实现了平均性能的突破性提升。项目页面:https://rewatch-r1.github.io

关键词

引用

@article{arxiv.2509.23652,
  title  = {ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis},
  author = {Congzhi Zhang and Zhibin Wang and Yinchao Ma and Jiawei Peng and Yihan Wang and Qiang Zhou and Jun Song and Bo Zheng},
  journal= {arXiv preprint arXiv:2509.23652},
  year   = {2025}
}