中文

通过反事实强化学习学习时空感知性:视频大语言模型的学习方法

计算机视觉与模式识别 2026-05-22 v1 人工智能

摘要

视频大语言模型(Video LLMs)在基准测试上取得了强烈的准确率,但常常通过单帧线索和语言先验等捷径来回答视频问题,而非通过跟踪时空动态。这种问题在RL后训练中尤为突出,因为仅基于正确性的奖励会进一步强化那些在不跟踪视频动态即可获得高奖励的捷径策略。我们通过提出一个受控的反事实问题来应对:如果在问题保持不变的同时,视觉世界发生了变化,答案是应该改变还是保持不变?基于此观点,我们提出了‛反事实关系策略优化(Counterfactual Relational Policy Optimization, CRPO)”,这是一种用于提高时空感知性的双分支RL框架。CRPO通过水平翻转和时间反转生成反事实视频,在原始和反事实两个分支上进行训练,引入‛反事实关系奖励(Counterfactual Relation Reward, CRR)”来衡量两者答案之间的关系。CRR鼓励动态问题的答案发生变化,而静态问题的答案保持不变。这种跨分支的约束使得捷径策略在两个分支上都无法获得一致的奖励。为评估这一属性,我们引入‛DyBench”,一个包含3,014个视频的人工匹配反事实视频基准,覆盖可逆动态、移动方向和事件序列,并配备严格的配对准确度度量标准,以防止固定答案捷径人为提升分数。实验表明,CRPO在时空敏感性评估方面超越了先前的RL方法,同时保持了有竞争力的通用视频性能。在Qwen3-VL-8B模型上,CRPO相对于基础模型在DyBench P-Acc上提升了+7.7,在TimeBlind I-Acc上提升了+8.2,表明其时空感知性得到了提升,而非更依赖静态捷径。项目网站可在https://ddz16.github.io/crpo.github.io/ 查找。

关键词

引用

@article{arxiv.2605.21988,
  title  = {Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning},
  author = {Dazhao Du and Jian Liu and Jialong Qin and Tao Han and Bohai Gu and Fangqi Zhu and Yujia Zhang and Eric Liu and Xi Chen and Song Guo},
  journal= {arXiv preprint arXiv:2605.21988},
  year   = {2026}
}

备注

Project website: https://ddz16.github.io/crpo.github.io/