中文

MoAlign:面向视频扩散模型的以运动为中心的表示对齐

计算机视觉与模式识别 2025-10-23 v1

摘要

文本到视频扩散模型已实现高质量的视频合成,但往往无法生成时间上连贯且物理上合理的运动。一个关键原因在于模型对自然视频中常包含的复杂运动理解不足。近期工作通过将扩散模型特征与预训练视频编码器的特征进行对齐来解决这一问题。然而,这些编码器将视频外观与动态混合为纠缠特征,限制了此类对齐的收益。在本文中,我们提出了一种以运动为中心的对齐框架,从预训练视频编码器中学习解耦的运动子空间。该子空间经过优化以预测真实光流,确保其捕获真实的运动动态。然后,我们将文本到视频扩散模型的潜在特征与这一新子空间对齐,使生成模型能够内化运动知识并生成更合理的视频。我们的方法改进了最先进视频扩散模型中的物理常识,同时保持了对文本提示的遵循,这在 VideoPhy、VideoPhy2、VBench 和 VBench-2.0 上的实证评估以及用户研究中得到了证实。

关键词

引用

@article{arxiv.2510.19022,
  title  = {MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models},
  author = {Aritra Bhowmik and Denis Korzhenkov and Cees G. M. Snoek and Amirhossein Habibian and Mohsen Ghafoorian},
  journal= {arXiv preprint arXiv:2510.19022},
  year   = {2025}
}