中文

用于视频生成模型的物理引导运动损失

计算机视觉与模式识别 2025-09-29 v2 人工智能

摘要

当前的视频扩散模型能生成视觉上引人注目的内容,但常常违反基本物理定律,产生诸如橡皮板变形与物体运动不一致等细微的伪影。我们引入了一种频域物理先验,在不修改模型架构的情况下提升了运动的合理性。我们的方法将常见的刚体运动(平移、旋转、缩放)分解为轻量级频谱损失,仅需 2.7% 的频率系数,同时保留了 97% 以上的频谱能量。应用于 Open-Sora、MVDIT 和 Hunyuan 时,我们的方法在 OpenVID-1M 上将运动准确性与动作识别平均提高了约 11%(相对值),同时保持了视觉质量。用户研究表明,74% 至 83% 的用户更偏好我们经过物理增强的视频。它还将扭曲误差降低了 22% 至 37%(取决于骨干网络),并提升了时间一致性得分。这些结果表明,简单、全局的频谱线索是视频扩散中物理合理运动的有效即插即用正则化器。

关键词

引用

@article{arxiv.2506.02244,
  title  = {Physics-Guided Motion Loss for Video Generation Model},
  author = {Bowen Xue and Giuseppe Claudio Guarnera and Shuang Zhao and Zahra Montazeri},
  journal= {arXiv preprint arXiv:2506.02244},
  year   = {2025}
}