中文

视频生成中的重力问题?基于可验证奖励的牛顿定律后训练

计算机视觉与模式识别 2025-12-02 v1

摘要

近期视频扩散模型能够合成视觉上令人愉悦的片段,但常常违反基本物理定律——对象漂浮、加速度漂移、碰撞行为不一致——这揭示了视觉真实性与物理真实性之间的持续鸿沟。我们提出了 NewtonRewards,首个基于可验证奖励的物理驱动视频生成后训练框架。不依赖人类或 VLM 反馈,NewtonRewards 从生成视频中提取可测量的代理指标:光流作为速度代理,高层外观特征作为质量代理。这些代理使我们能够通过两种互补奖励显式地强制执行牛顿结构:一种是强制恒定加速度动力学的牛顿运动约束,另一种是防止平凡、退化解的质量守恒奖励。我们在五类牛顿运动原语(自由下落、水平/抛物线抛掷、坡面上下滑动)上评估了 NewtonRewards,同时构建了新的大型基准数据集 NewtonBench-60K。在所有运动原语的视觉与物理指标上,NewtonRewards 在物理合理性、运动平滑性和时间一致性方面均优于先前后训练方法。它还在高度、速度和摩擦力等分布外偏移下保持强性能。我们的结果表明,物理驱动的可验证奖励为物理感知视频生成提供了可扩展的路径。

关键词

引用

@article{arxiv.2512.00425,
  title  = {What about gravity in video generation? Post-Training Newton's Laws with Verifiable Rewards},
  author = {Minh-Quan Le and Yuanzhi Zhu and Vicky Kalogeiton and Dimitris Samaras},
  journal= {arXiv preprint arXiv:2512.00425},
  year   = {2025}
}

备注

Project page: https://cvlab-stonybrook.github.io/NewtonRewards