中文

Customize-A-Video:文本到视频扩散模型的一次性运动定制

计算机视觉与模式识别 2024-08-29 v3

摘要

图像定制已在文本到图像 (Text-to-image, T2I) 扩散模型中得到广泛研究,并取得了令人瞩目的成果和应用。随着文本到视频 (Text-to-video, T2V) 扩散模型的出现,其时间对应物——运动定制——尚未得到充分研究。为了解决一次性视频运动定制的挑战,我们提出了 Customize-A-Video,该方法从单个参考视频中对运动进行建模,并将其适应于具有空间和时间变化的新主体和场景。它利用时间注意力层上的低秩自适应 (Low-rank adaptation, LoRA) 来调整预训练的 T2V 扩散模型以进行特定的运动建模。为了在训练过程中解耦空间和时间信息,我们引入了一种名为“外观吸收器”(appearance absorbers) 的新概念,即在运动学习之前将原始外观从参考视频中分离出来。所提出的模块在分阶段流水线中进行训练,并以即插即用的方式进行推理,从而能够轻松扩展到各种下游任务,如自定义视频生成和编辑、视频外观定制以及多重运动组合。我们的项目页面位于 https://customize-a-video.github.io。

关键词

引用

@article{arxiv.2402.14780,
  title  = {Customize-A-Video: One-Shot Motion Customization of Text-to-Video Diffusion Models},
  author = {Yixuan Ren and Yang Zhou and Jimei Yang and Jing Shi and Difan Liu and Feng Liu and Mingi Kwon and Abhinav Shrivastava},
  journal= {arXiv preprint arXiv:2402.14780},
  year   = {2024}
}

备注

Accepted by ECCV 2024. Project page: https://customize-a-video.github.io