MotionDirector:文本到视频扩散模型的运动定制
计算机视觉与模式识别
2023-10-13 v1
摘要
大规模预训练扩散模型已在多样化视频生成中展现出显著能力。给定同一运动概念的一组视频片段,运动定制任务是调整现有的文本到视频扩散模型以生成具有该运动的视频。例如,在指定摄像机运动下生成汽车以规定方式移动的视频以制作电影,或生成展示熊如何举重的视频以启发创作者。已有用于定制外观(如主体或风格)的适配方法,但运动方面尚未探索。将主流适配方法(包括全模型微调、附加层的参数高效微调以及低秩适配(LoRA))扩展用于运动定制是直接的。然而,这些方法学到的运动概念常与训练视频中有限的外观耦合,难以将定制的运动泛化到其他外观。为克服此挑战,我们提出 MotionDirector,采用双路径 LoRA 架构来解耦外观与运动的学习。此外,我们设计了一种新颖的外观去偏时序损失,以减轻外观对时序训练目标的影响。实验结果表明,所提方法能为定制运动生成多样外观的视频。我们的方法还支持多种下游应用,例如将不同视频的外观与运动分别混合,以及用定制运动为单张图像制作动画。我们的代码和模型权重将公开发布。
引用
@article{arxiv.2310.08465,
title = {MotionDirector: Motion Customization of Text-to-Video Diffusion Models},
author = {Rui Zhao and Yuchao Gu and Jay Zhangjie Wu and David Junhao Zhang and Jiawei Liu and Weijia Wu and Jussi Keppo and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2310.08465},
year = {2023}
}
备注
Project Page: https://showlab.github.io/MotionDirector/