中文

Phantom:基于联合建模视觉与潜在物理动态的物理驱动视频生成

计算机视觉与模式识别 2026-05-20 v3

摘要

近期大规模数据集和强大架构推动了生成式视频建模,产生了惊人的视觉真实性。然而,新兴证据表明,仅靠规模化数据和模型大小并不赋予这些系统对支配现实世界动态的物理法则的理解。现有方法往往无法捕获或强制实现这种物理一致性,导致不真实的运动和动态。在本工作中,我们研究whether将潜在物理属性的推断直接集成到视频生成过程中能否为模型提供生成物理上合情视频的能力。为此,我们提出了Phantom,一个物理驱动视频生成模型,通过联合建模视觉内容和潜在物理动态来实现这一目标。基于观测视频帧和推断的物理状态,Phantom联合预测潜在物理动态并生成未来视频帧。Phantom利用一种物理感知视频表示,作为对底层物理的抽象且信息丰富的嵌入,促进了在无需为复杂物理动态和属性进行显式指定的情况下,联合预测物理动态与视频内容。通过将物理感知视频表示的推断直接集成到视频生成过程中,Phantom产生既视觉真实又物理一致的视频序列。在标准视频生成和物理感知基准上的定量和定性结果表明,Phantom不仅在遵循物理动态方面超越了现有方法,也在感知保真度方面表现出竞争力。

关键词

引用

@article{arxiv.2604.08503,
  title  = {Phantom: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamics},
  author = {Ying Shen and Jerry Xiong and Tianjiao Yu and Ismini Lourentzou},
  journal= {arXiv preprint arXiv:2604.08503},
  year   = {2026}
}

备注

15 pages, 6 figures, CVPR 2026