中文

CustomCrafter: 保留运动与概念组合能力的定制化视频生成

计算机视觉与模式识别 2024-12-30 v2

摘要

定制化视频生成旨在根据文本提示和主体的参考图像生成高质量视频。然而,由于它仅在静态图像上训练,主体学习的微调过程会破坏视频扩散模型(VDMs)组合概念和生成运动的能力。为了恢复这些能力,一些方法使用与提示相似的额外视频来微调或引导模型。这需要频繁更换引导视频,甚至在生成不同运动时重新调整模型,对用户来说非常不便。在本文中,我们提出了CustomCrafter,一个新颖的框架,无需额外视频和微调即可恢复模型,从而保留其运动生成和概念组合能力。为了保留概念组合能力,我们设计了一个即插即用模块来更新VDMs中的少量参数,增强了模型捕捉新主体外观细节和概念组合的能力。对于运动生成,我们观察到VDMs在去噪早期倾向于恢复视频的运动,而在后期则专注于恢复主体细节。因此,我们提出了动态加权视频采样策略。利用我们主体学习模块的可插拔性,我们在去噪早期减少了该模块对运动生成的影响,保留了VDMs生成运动的能力。在去噪后期,我们恢复该模块以修复指定主体的外观细节,从而确保主体外观的保真度。实验结果表明,我们的方法与之前的方法相比有显著改进。代码可在 https://github.com/WuTao-CS/CustomCrafter 获取。

关键词

引用

@article{arxiv.2408.13239,
  title  = {CustomCrafter: Customized Video Generation with Preserving Motion and Concept Composition Abilities},
  author = {Tao Wu and Yong Zhang and Xintao Wang and Xianpan Zhou and Guangcong Zheng and Zhongang Qi and Ying Shan and Xi Li},
  journal= {arXiv preprint arXiv:2408.13239},
  year   = {2024}
}

备注

Accepted by AAAI 2025. Project page: https://customcrafter.github.io/