中文

基于潜在物理引导的物理感知视频生成:PhysVideoGenerator

计算机视觉与模式识别 2026-01-08 v1

摘要

当前视频生成模型产生高质量美学视频,但常在学习真实世界物理动态表示方面困难,导致出现不自然的物体碰撞、重力不一致以及时间性抽动等伪影。本文提出PhysVideoGenerator,一个将可学习的物理先验显式嵌入视频生成过程的概念验证框架。我们引入轻量级预测网络PredictorP,从预训练的Video Joint Embedding Predictive Architecture (V-JEPA 2)中提取的高级物理特征进行回归,这些特征直接来自噪声扩散潜在表示。这些预测的物理标记通过专用的交叉注意力机制注入基于DiT生成器(Latte)的时序注意力层中。我们的主要贡献在于演示了这种联合训练范式的技术可行性:我们展示扩散潜在表示包含足够的信息来恢复V-JEPA 2物理表示,并且在训练期间多任务优化保持稳定。这份报告记录了架构设计、技术挑战以及训练稳定性验证,为未来大规模评估物理感知生成模型奠定了基础。

关键词

引用

@article{arxiv.2601.03665,
  title  = {PhysVideoGenerator: Towards Physically Aware Video Generation via Latent Physics Guidance},
  author = {Siddarth Nilol Kundur Satish and Devesh Jaiswal and Hongyu Chen and Abhishek Bakshi},
  journal= {arXiv preprint arXiv:2601.03665},
  year   = {2026}
}

备注

9 pages, 2 figures, project page: https://github.com/CVFall2025-Project/PhysVideoGenerator