中文

LaMo:用于视频生成物理真实性的自监督潜在运动先验

计算机视觉与模式识别 2026-05-25 v1

摘要

现代视频生成器虽然能够产生视觉上引人入目的数据段,但仍在物理和运动一致性方面存在挑战,限制了其作为可靠世界模拟器的应用。现有的解决方案通常依赖外部模拟器、教师模型或精选的物理导向数据。我们探索了一种互补的自监督方法:从用于训练视频扩散模型的无标记视频中提取运动线索。我们提出了 LaMo,通过在当前潜在表示和提示条件下,对帧间潜在变化 formulation 了潜在运动先验。该先验通过两种轻量级读出机制进行暴露:一种用于训练时的宏观运动漂移(Motion Drift Loss),另一种用于采样时的学习型微观运动场(Motion Prior Guidance)。这两个组件均为即插即用的设计,无需修改现有的视频扩散模型的架构或输入输出。实验表明,在 VideoPhy 和 VideoPhy2 数据集上,LaMo 改进了 CogVideoX 系列模型,并优于使用外部监督的最新物理感知基线方法。在 VBench 上,LaMo 能够保持整体生成质量,同时提升运动相关维度的表现。这些结果表明,无标记视频包含有助于改进现代视频扩散模型物理保真度的有用运动监督信号。

关键词

引用

@article{arxiv.2605.23878,
  title  = {LaMo: Self-Supervised Latent Motion Priors for Physical Realism in Video Generation},
  author = {Bo Jiang and Depu Meng and Yihan Hu and Yichen Xie and Tianshuo Xu and Wei Zhan},
  journal= {arXiv preprint arXiv:2605.23878},
  year   = {2026}
}

备注

Project Page: https://lamo-ai.github.io/