中文

Motion-Zero:面向基于扩散的视频生成的零样本运动物体控制框架

计算机视觉与模式识别 2025-01-09 v4

摘要

近期的大规模预训练扩散模型展示了从详细文本描述生成高质量视频的强大生成能力。然而,对任何视频扩散模型生成的视频中的物体运动进行控制是一个具有挑战性的问题。在本文中,我们提出了一种新颖的零样本运动物体轨迹控制框架 Motion-Zero,以实现由边界框轨迹控制的文本到视频扩散模型。为此,设计了一个初始噪声先验模块,以提供基于位置的先验,从而提高运动物体外观的稳定性和位置的准确性。此外,基于 U-net 的注意力图,将空间约束直接应用于扩散模型的去噪过程,进一步确保了推理过程中运动物体的位置和空间一致性。此外,通过提出的偏移时间注意力机制保证了时间一致性。我们的方法无需任何训练过程即可灵活应用于各种最先进的视频扩散模型。大量实验表明,我们提出的方法能够控制物体的运动轨迹并生成高质量的视频。我们的项目页面是 https://vpx-ecnu.github.io/MotionZero-website/

关键词

引用

@article{arxiv.2401.10150,
  title  = {Motion-Zero: Zero-Shot Moving Object Control Framework for Diffusion-Based Video Generation},
  author = {Changgu Chen and Junwei Shu and Gaoqi He and Changbo Wang and Yang Li},
  journal= {arXiv preprint arXiv:2401.10150},
  year   = {2025}
}

备注

Preprint