DynamiCrafter:利用视频扩散先验为开放域图像生成动画
计算机视觉与模式识别
2023-11-28 v2
摘要
为静态图像添加动画可带来引人入胜的视觉体验。传统图像动画技术主要聚焦于对具有随机动态(如云与流体)或特定领域运动(如人的头发或身体运动)的自然场景进行动画处理,因而限制了其对更通用视觉内容的适用性。为克服该局限,我们探索为开放域图像合成动态内容,将其转化为动画视频。核心思路是利用文本到视频扩散模型的运动先验,将图像作为引导纳入生成过程。给定一幅图像,我们首先使用查询变换器(query transformer)将其投影至文本对齐的丰富上下文表征空间,从而便于视频模型以兼容方式理解图像内容。然而,部分视觉细节在所得视频中仍难以保留。为补充更精确的图像信息,我们进一步将完整图像与初始噪声拼接后输入扩散模型。实验结果表明,我们所提方法能生成视觉上令人信服且更符合逻辑与自然的运动,并与输入图像具有更高的一致性。对比评估显示了我们的方法相较现有竞争对手的显著优越性。
引用
@article{arxiv.2310.12190,
title = {DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors},
author = {Jinbo Xing and Menghan Xia and Yong Zhang and Haoxin Chen and Wangbo Yu and Hanyuan Liu and Xintao Wang and Tien-Tsin Wong and Ying Shan},
journal= {arXiv preprint arXiv:2310.12190},
year = {2023}
}
备注
Project page: https://doubiiu.github.io/projects/DynamiCrafter