AnimateZero:视频扩散模型是零样本图像动画器
计算机视觉与模式识别
2023-12-08 v1
摘要
大规模文本到视频(T2V)扩散模型近年来在视觉质量、运动和时间一致性方面取得了巨大进展。然而,生成过程仍然是一个黑盒,其中所有属性(例如外观、运动)都是联合学习和生成的,除了粗略的文本描述外缺乏精确的控制能力。受图像动画将视频解耦为特定外观及相应运动的启发,我们提出 AnimateZero 以揭开预训练的文本到视频扩散模型(即 AnimateDiff)的面纱,并为其提供更精确的外观和运动控制能力。对于外观控制,我们借用文本到图像(T2I)生成中的中间潜变量及其特征,以确保生成的第一帧与给定的生成图像相等。对于时间控制,我们用我们提出的位置校正窗口注意力替换原始 T2V 模型的全局时间注意力,以确保其他帧与第一帧良好对齐。凭借所提出的方法,AnimateZero 能够在无需进一步训练的情况下成功控制生成过程。作为针对给定图像的零样本图像动画器,AnimateZero 还支持多种新应用,包括交互式视频生成和真实图像动画。详细的实验证明了所提出方法在 T2V 及相关应用中的有效性。
引用
@article{arxiv.2312.03793,
title = {AnimateZero: Video Diffusion Models are Zero-Shot Image Animators},
author = {Jiwen Yu and Xiaodong Cun and Chenyang Qi and Yong Zhang and Xintao Wang and Ying Shan and Jian Zhang},
journal= {arXiv preprint arXiv:2312.03793},
year = {2023}
}
备注
Project Page: https://vvictoryuki.github.io/animatezero.github.io/