中文

AnimateDiff:无需特定调优即可动画化您的个性化文本到图像扩散模型

计算机视觉与模式识别 2024-02-09 v2 图形学 机器学习

摘要

随着文本到图像(T2I)扩散模型(如 Stable Diffusion)以及相应的个性化技术(如 DreamBooth 和 LoRA)的发展,任何人都能以可承受的成本将想象转化为高质量图像。然而,为现有高质量个性化 T2I 添加运动动态并使其生成动画仍是一个开放挑战。在本文中,我们提出 AnimateDiff,一个用于动画化个性化 T2I 模型的实用框架,无需模型特定调优。我们框架的核心是一个即插即用的运动模块,可训练一次并无缝集成到源自同一基础 T2I 的任何个性化 T2I 中。通过我们提出的训练策略,该运动模块从真实世界视频中有效学习可迁移的运动先验。一旦训练完成,该运动模块可插入个性化 T2I 模型以形成个性化动画生成器。我们进一步提出 MotionLoRA,一种用于 AnimateDiff 的轻量级微调技术,使预训练运动模块能以较低的训练与数据收集成本适应新运动模式(如不同镜头类型)。我们在从社区收集的若干公开代表性个性化 T2I 模型上评估 AnimateDiff 与 MotionLoRA。结果表明,我们的方法有助于这些模型生成时间上平滑的动画片段,同时保留视觉质量与运动多样性。代码与预训练权重见 https://github.com/guoyww/AnimateDiff。

关键词

引用

@article{arxiv.2307.04725,
  title  = {AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning},
  author = {Yuwei Guo and Ceyuan Yang and Anyi Rao and Zhengyang Liang and Yaohui Wang and Yu Qiao and Maneesh Agrawala and Dahua Lin and Bo Dai},
  journal= {arXiv preprint arXiv:2307.04725},
  year   = {2024}
}

备注

Codes and Supplementary Material: https://github.com/guoyww/AnimateDiff