VIDEOP2R:从感知到推理的时间视频理解
计算机视觉与模式识别
2026-04-21 v2 人工智能
机器学习
摘要
强化微调(RFT)是由监督微调(SFT)和强化学习(RL)组成的两个阶段框架,已在提升大型语言模型(LLM)推理能力方面显示出前景。然而,将RFT扩展到大型视频语言模型(LVLMs)仍存在挑战。我们提出了VideoP2R,一个新颖的面向过程的时间RFT框架,通过将感知和推理建模为两个独立的过程来增强视频推理。在SFT阶段,我们开发了一个三步管线,用于生成VideoP2R-CoT-162K,这是一个高质量的、面向感知和推理的过程感知链式思维(CoT)数据集。在RL阶段,我们引入了一种新颖的面向过程的相对策略优化(PA-GRPO)算法,为感知和推理分别提供奖励。大量实验表明,VideoP2R在六个七个视频推理和理解基准测试中实现了最先进(SotA)性能。消融研究进一步确认了我们面向过程建模和PA-GRPO的有效性,并表明模型的感知输出对下游推理具有信息充分性。我们的项目页面位于https://videop2r.github.io/videop2r/。
引用
@article{arxiv.2511.11113,
title = {VIDEOP2R: Video Understanding from Perception to Reasoning},
author = {Yifan Jiang and Yueying Wang and Rui Zhao and Toufiq Parag and Zhimin Chen and Zhenyu Liao and Jayakrishnan Unnikrishnan},
journal= {arXiv preprint arXiv:2511.11113},
year = {2026}
}
备注
CVPR Findings 2026