Video-R1:用于强化多模态大语言模型中视频推理的 R1 范式
计算机视觉与模式识别
2025-10-23 v4
摘要
受 DeepSeek-R1 通过基于规则的强化学习(RL)成功激发推理能力的启发,我们提出 Video-R1,作为首个系统探索 R1 范式以激励多模态大语言模型(MLLMs)中视频推理的尝试。然而,直接将 RL 训练与 GRPO 算法应用于视频推理存在两个主要挑战:(i)缺乏对视频推理的时序建模,(ii)高质量视频推理数据的稀缺。为解决这些问题,我们首先提出 T-GRPO 算法,鼓励模型在推理时利用视频中的时序信息。此外,除了依赖视频数据外,我们还纳入高质量图像推理数据进行训练。我们构建了两个数据集:用于 SFT 冷启动的 Video-R1-CoT-165k,以及用于 RL 训练的 Video-R1-260k,两者均包含图像和视频数据。实验结果表明,Video-R1 在诸如 VideoMMMU 和 VSI-Bench 等视频推理基准测试中取得显著提升,同时在包括 MVBench 和 TempCompass 在内的通用视频基准测试中也表现出色。值得注意的是,Video-R1-7B 在视频空间推理基准 VSI-bench 上达到 37.1% 的准确率,超越了商业专有模型 GPT-4o。所有代码、模型和数据均已发布:https://github.com/tulerfeng/Video-R1。
引用
@article{arxiv.2503.21776,
title = {Video-R1: Reinforcing Video Reasoning in MLLMs},
author = {Kaituo Feng and Kaixiong Gong and Bohao Li and Zonghao Guo and Yibing Wang and Tianshuo Peng and Junfei Wu and Xiaoying Zhang and Benyou Wang and Xiangyu Yue},
journal= {arXiv preprint arXiv:2503.21776},
year = {2025}
}
备注
NeurIPS 2025, Project page: https://github.com/tulerfeng/Video-R1