中文

通过合成视频学习可迁移的时序原语,用于视频推理

计算机视觉与模式识别 2026-03-19 v1

摘要

从图像到视频理解的转变需要视觉语言模型(VLM)从识别静态模式转向推理时序动态,如运动轨迹、速度变化和状态转换。然而,当前的后训练方法存在两个关键局限:(1)现有数据集常缺乏时序中心性,答案可从孤立的关键帧推断,而无需整体时序集成;(2)由专有模型生成的训练数据在基本时序感知方面存在系统性错误,如混淆运动方向或误判速度。我们引入 SynRL,一个教授模型时序原语的后训练框架,这些原语是时序理解的基本构建块,包括方向、速度和状态跟踪。我们的关键洞察是,这些抽象原语从程序生成的合成视频中学习,能有效迁移到真实场景。我们将时序理解分解为短期感知原语(速度、方向)和长期认知原语,构建了 7.7K 个链式推理(CoT)和 7K 个强化学习(RL)样本,通过基于代码的视频生成获得帧级注释。尽管仅在简单几何形状上训练,SynRL 在涵盖时序定位、复杂推理和通用视频理解的 15 个基准上实现显著提升。令人惊讶的是,我们的 7.7K 个合成 CoT 样本甚至超过了 165K 个真实世界样本的 Video-R1。我们归因于从抽象合成模式迁移到复杂真实场景的基本时序技能,如逐帧跟踪变化并比较速度。这建立了一种新的视频后训练范式:通过精心设计的合成数据进行视频时序学习,提供了更具成本效益的规模化路径。

关键词

引用

@article{arxiv.2603.17693,
  title  = {Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos},
  author = {Songtao Jiang and Sibo Song and Chenyi Zhou and Yuan Wang and Ruizhe Chen and Tongkun Guan and Ruilin Luo and Yan Zhang and Zhihang Tang and Yuchong Sun and Hang Zhang and Zhibo Yang and Shuai Bai and Junyang Lin and Zuozhu Liu},
  journal= {arXiv preprint arXiv:2603.17693},
  year   = {2026}
}