中文

NewtonGen:基于神经牛顿动力学的物理一致且可控文本到视频生成

计算机视觉与模式识别 2026-03-31 v2

摘要

大规模文本到视频生成的主要瓶颈是物理一致性和可控性。尽管近期取得的进展,领先的模型常常产生不真实的运动,例如物体向上坠落,或速度和方向的突然变化。此外,这些模型缺乏精确的参数控制,难以在不同的初始条件下生成物理一致的运动。我们认为,这一根本性限制源于当前模型仅从外观学习运动分布,而缺乏对底层动力学的理解。本文提出NewtonGen,一个集成数据驱动合成与可学习物理原理的框架。其核心是可训练的神经牛顿动力学(NND),能够建模和预测各种牛顿运动,从而将潜在动力学约束注入视频生成过程。通过联合利用数据先验和动力学引导,NewtonGen实现了具有精确参数控制的物理一致视频合成。所有数据和代码均可在 https://github.com/pandayuanyu/NewtonGen 获得。

关键词

引用

@article{arxiv.2509.21309,
  title  = {NewtonGen: Physics-Consistent and Controllable Text-to-Video Generation via Neural Newtonian Dynamics},
  author = {Yu Yuan and Xijun Wang and Tharindu Wickremasinghe and Zeeshan Nadir and Bole Ma and Stanley H. Chan},
  journal= {arXiv preprint arXiv:2509.21309},
  year   = {2026}
}

备注

Accepted by ICLR 2026. Camera-ready version. Project Page: https://yuyuanspace.com/NewtonGen/