中文

TI2V-Zero:文本到视频扩散模型的零样图象条件生成

计算机视觉与模式识别 2024-04-26 v1

摘要

文本条件图像到视频生成(TI2V)旨在从给定图像(例如,女性照片)和文本描述(例如,"女性在喝水。")合成逼真的视频。现有的TI2V框架通常需要针对视频文本数据进行高成本训练,并为文本和图像条件设计特定模型。在本文中,我们提出TI2V-Zero,一种零样本、无调参的方法,使预训练的文本到视频(T2V)扩散模型能够对提供的图像进行条件化,从而实现无任何优化、微调或引入外部模块的TI2V生成。我们的方法利用预训练的T2V扩散基础模型作为生成先验。为引导额外的图像输入驱动视频生成,我们提出一种"重复-滑动"策略,用于调制逆去噪过程,使冻结的扩散模型能够从提供的图像逐帧合成视频。为确保时间连续性,我们采用DDPM反向方法为每个新生成的帧初始化高斯噪声,并采用重抽样技术帮助保持视觉细节。我们在域特定和开放域数据集上进行了全面实验,其中TI2V-Zero持续优于最近的开放域TI2V模型。此外,我们展示TI2V-Zero可以无缝扩展到其他任务,如视频填充和预测,当提供更多图像时。其自回归设计也支持长视频生成。

关键词

引用

@article{arxiv.2404.16306,
  title  = {TI2V-Zero: Zero-Shot Image Conditioning for Text-to-Video Diffusion Models},
  author = {Haomiao Ni and Bernhard Egger and Suhas Lohit and Anoop Cherian and Ye Wang and Toshiaki Koike-Akino and Sharon X. Huang and Tim K. Marks},
  journal= {arXiv preprint arXiv:2404.16306},
  year   = {2024}
}

备注

CVPR 2024