中文

MotionCrafter:扩散模型的一次性运动定制

计算机视觉与模式识别 2024-01-04 v2

摘要

视频的本质在于其动态运动,包括角色动作、物体运动和镜头运动。尽管文本到视频的生成式扩散模型最近在创建多样化内容方面取得了进展,但通过文本提示控制特定运动仍然是一个重大挑战。一个主要问题是外观与运动的耦合,往往导致对外观的过拟合。为了应对这一挑战,我们引入了 MotionCrafter,一种新颖的一次性实例引导运动定制方法。MotionCrafter 采用并行的时空架构,将参考运动注入基础模型的时间组件中,同时空间模块独立调整以进行角色或风格控制。为了增强运动与外观的解耦,我们提出了一种创新的双分支运动解耦方法,包括运动解耦损失和外观先验增强策略。在训练期间,冻结的基础模型提供外观归一化,有效地将外观与运动分离,从而保持多样性。全面的定量和定性实验以及用户偏好测试表明,MotionCrafter 能够成功整合动态运动,同时保持基础模型的连贯性和质量,并具备广泛的外观生成能力。项目页面:https://zyxelsa.github.io/homepage-motioncrafter。代码可在 https://github.com/zyxElsa/MotionCrafter 获取。

关键词

引用

@article{arxiv.2312.05288,
  title  = {MotionCrafter: One-Shot Motion Customization of Diffusion Models},
  author = {Yuxin Zhang and Fan Tang and Nisha Huang and Haibin Huang and Chongyang Ma and Weiming Dong and Changsheng Xu},
  journal= {arXiv preprint arXiv:2312.05288},
  year   = {2024}
}