中文

PhysRVG:面向视频生成模型的物理感知统一强化学习

计算机视觉与模式识别 2026-01-19 v1

摘要

物理原理是逼真视觉模拟的基础,但在基于Transformer的视频生成中仍是一个重大疏漏。这一差距突显了在渲染刚体运动(经典力学的核心原则)方面的关键局限性。虽然计算机图形学和基于物理的模拟器可以使用牛顿公式轻松建模此类碰撞,但现代预训练-微调范式在像素级全局去噪过程中丢弃了物体刚性的概念。即使完全正确的数学约束在训练后的模型优化中也被视为次优解(即条件),从根本上限制了生成视频的物理真实性。受这些考虑启发,我们首次为视频生成模型引入了物理感知强化学习范式,该范式在高维空间中直接强制执行物理碰撞规则,确保物理知识被严格执行而非被视为条件。随后,我们将该范式扩展为一个统一框架,称为模拟-发现循环(Mimicry-Discovery Cycle, MDcycle),该框架允许在进行充分微调的同时完全保留模型利用基于物理的反馈的能力。为了验证我们的方法,我们构建了新的基准 PhysRVGBench 并进行了广泛的定性和定量实验以彻底评估其有效性。

关键词

引用

@article{arxiv.2601.11087,
  title  = {PhysRVG: Physics-Aware Unified Reinforcement Learning for Video Generative Models},
  author = {Qiyuan Zhang and Biao Gong and Shuai Tan and Zheng Zhang and Yujun Shen and Xing Zhu and Yuyuan Li and Kelu Yao and Chunhua Shen and Changqing Zou},
  journal= {arXiv preprint arXiv:2601.11087},
  year   = {2026}
}