中文

ViSS-R1:基于自监督强化学习的视频推理

计算机视觉与模式识别 2025-11-18 v1

摘要

复杂视频推理是多模态大语言模型(MLLMs)面临的重大挑战,因为当前基于R1的方法往往优先考虑从文本数据或图像数据中派生的文本中心推理。在视频任务中,这种策略常常未充分利用丰富的视觉信息,导致潜在的捷径学习和更易受幻觉影响。为了培育更稳健、以视觉为中心的视频理解能力,我们首先在标准R1管道中引入一种新的自监督强化学习GRPO算法(Pretext-GRPO),其中对正确解决变换后视觉输入上的预置任务赋予正奖励,以此使模型必须非平凡地处理视觉信息。基于Pretext-GRPO的有效性,我们进一步提出了ViSS-R1框架,将预置任务基于自监督学习直接整合到MLLM的R1后训练范式中。我们的框架不依赖稀疏的视觉线索,而是要求模型同时处理预置问题(涉及变换)和真实用户查询,这要求模型识别所采用的变换并重构原始视频,以制定准确的最终答案。全面评估显示,我们的Pretext-GRPO和ViSS-R1在六个广泛使用的视频推理和理解基准测试上均显示出有效性和优越性。我们的代码和模型将公开提供。

关键词

引用

@article{arxiv.2511.13054,
  title  = {ViSS-R1: Self-Supervised Reinforcement Video Reasoning},
  author = {Bo Fang and Yuxin Song and Qiangqiang Wu and Haoyuan Sun and Wenhao Wu and Antoni B. Chan},
  journal= {arXiv preprint arXiv:2511.13054},
  year   = {2025}
}

备注

Our paper was initially titled "Video-SSR1: Self-Supervised Reinforcement Video Reasoning." Upon noticing its close resemblance to the title of a recently released paper, we have decided to rename our work as "ViSS-R1."