LMP:在零样本视频生成中利用运动先验的扩散 Transformer
计算机视觉与模式识别
2025-05-21 v1
摘要
近年来,大规模预训练扩散 Transformer 模型在视频生成方面取得了显著进展。虽然当前的 DiT 模型能够生成高清、高帧率且高度多样化的视频,但缺乏对视频内容的细粒度控制。仅凭提示词控制视频中主体的运动具有挑战性,尤其是描述复杂运动时。进一步,现有方法在图像到视频生成中无法控制运动,因为参考图像中的主体在初始位置、大小和形状上与参考视频中的主体不同。为此,本文提出了一种称为 LMP(Leveraging Motion Prior)的框架,用于零样本视频生成。我们的框架利用预训练扩散 Transformer 的强大生成能力,使生成视频中的运动能够参考用户提供的运动视频,无论是文本到视频还是图像到视频生成。为此,我们首先引入前景-背景解缝模块,以区分参考视频中移动主体和背景,从而防止干扰目标视频的生成。设计了一种重加权运动迁移模块,使目标视频能够参考参考视频的运动。为避免参考视频中主体的干扰,我们提出了一种外观分离模块,以抑制目标视频中参考主体的外观。我们为实验标注了 DAVIS 数据集,并设计了评估指标以验证方法有效性。广泛实验表明,我们的方法在生成质量、提示-视频一致性和控制能力方面实现了最先进的性能。我们的主页地址为 https://vpx-ecnu.github.io/LMP-Website/。
关键词
引用
@article{arxiv.2505.14167,
title = {LMP: Leveraging Motion Prior in Zero-Shot Video Generation with Diffusion Transformer},
author = {Changgu Chen and Xiaoyan Yang and Junwei Shu and Changbo Wang and Yang Li},
journal= {arXiv preprint arXiv:2505.14167},
year = {2025}
}