中文

I4VGen:将图像作为文本到视频生成的自由步进点

计算机视觉与模式识别 2024-10-04 v2

摘要

文本到视频生成在质量和多样性方面滞后于文本到图像生成,这主要源于时空建模的复杂性以及视频文本数据稀缺的局限。最近的文本到视频扩散模型采用图像作为中间步骤,显著提升整体性能但代价高昂。本文提出I4VGen,一种新颖的视频扩散推理管道,利用先进的图像技术增强预训练文本到视频扩散模型,无需额外训练。与传统文本到视频推理管道不同,I4VGen包含两个阶段:锚点图像合成和锚点图像增强文本到视频生成。相应地,我们采用简单且有效的生成-选择策略以实现视觉逼真且语义忠实的锚点图像,开发创新的噪声不变视频得分蒸馏采样(NI-VSDS)以从视频扩散模型中蒸馏运动知识,将图像动画化为动态视频,随后进行视频再生成以细化视频。广泛的实验表明,所提方法生成的视频在视觉逼真度和文本忠实度方面均优于基线方法。此外,I4VGen还能无缝集成到现有的图像到视频扩散模型中,从而提升整体视频质量。

关键词

引用

@article{arxiv.2406.02230,
  title  = {I4VGen: Image as Free Stepping Stone for Text-to-Video Generation},
  author = {Xiefan Guo and Jinlin Liu and Miaomiao Cui and Liefeng Bo and Di Huang},
  journal= {arXiv preprint arXiv:2406.02230},
  year   = {2024}
}

备注

Project page: https://xiefan-guo.github.io/i4vgen