中文

Tune-A-Video:用于文本到视频生成的图像扩散模型一次性调优

计算机视觉与模式识别 2023-03-20 v2

摘要

为了复制文本到图像(T2I)生成的成功,近期工作采用大规模视频数据集来训练文本到视频(T2V)生成器。尽管其结果令人鼓舞,但这种范式计算开销巨大。在本工作中,我们提出一种新的 T2V 生成设定——一次性视频调优(One-Shot Video Tuning),其中仅给出一对文本-视频。我们的模型构建于在海量图像数据上预训练的先进 T2I 扩散模型之上。我们做出两个关键观察:1)T2I 模型可生成表示动词项的静图像;2)将 T2I 模型扩展为并发生成多张图像展现出令人惊讶的良好内容一致性。为了进一步学习连续运动,我们引入了 Tune-A-Video,其包含定制的时空注意力机制与高效的一次性调优策略。在推理时,我们采用 DDIM 反演为采样提供结构引导。大量定性与数值实验证明了我们的方法在各种应用中的卓越能力。

关键词

引用

@article{arxiv.2212.11565,
  title  = {Tune-A-Video: One-Shot Tuning of Image Diffusion Models for Text-to-Video Generation},
  author = {Jay Zhangjie Wu and Yixiao Ge and Xintao Wang and Weixian Lei and Yuchao Gu and Yufei Shi and Wynne Hsu and Ying Shan and Xiaohu Qie and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2212.11565},
  year   = {2023}
}

备注

Preprint