DreamVideo:使用自定义主体和动作合成你的梦想视频
计算机视觉与模式识别
2023-12-08 v1
摘要
基于扩散模型的定制化生成在图像生成领域取得了令人瞩目的进展,但在具有挑战性的视频生成任务中仍不尽如人意,因为它要求同时具备对主体和动作的可控性。为此,我们提出了 DreamVideo,这是一种新颖的方法,能够从所需主体的几张静态图像和目标动作的几段视频生成个性化视频。DreamVideo 通过利用预训练的视频扩散模型,将此任务解耦为两个阶段:主体学习和动作学习。主体学习旨在从提供的图像中精确捕捉主体的精细外观,这通过结合文本反转和我们精心设计的身份适配器的微调来实现。在动作学习中,我们构建了一个动作适配器,并在给定的视频上对其进行微调,以有效建模目标动作模式。结合这两个轻量级且高效的适配器,可以灵活地定制任何主体与任何动作。大量的实验结果表明,我们的 DreamVideo 在定制视频生成方面优于最先进的方法。我们的项目页面位于 https://dreamvideo-t2v.github.io。
引用
@article{arxiv.2312.04433,
title = {DreamVideo: Composing Your Dream Videos with Customized Subject and Motion},
author = {Yujie Wei and Shiwei Zhang and Zhiwu Qing and Hangjie Yuan and Zhiheng Liu and Yu Liu and Yingya Zhang and Jingren Zhou and Hongming Shan},
journal= {arXiv preprint arXiv:2312.04433},
year = {2023}
}