中文

利用无文本视频扩展文本到视频生成的配方

计算机视觉与模式识别 2023-12-27 v1 人工智能

摘要

基于扩散的文本到视频生成在过去一年中取得了令人瞩目的进展,但仍落后于文本到图像生成。关键原因之一是公开可用数据的规模有限(例如,WebVid10M中有1000万视频-文本对,而LAION中有50亿图像-文本对),考虑到视频标注的高成本。相反,从YouTube等视频平台收集未标注的视频片段要容易得多。受此启发,我们提出了一种新颖的文本到视频生成框架,称为TF-T2V,它可以直接利用无文本视频进行学习。其基本原理是将文本解码过程与时间建模过程分离。为此,我们采用了一个内容分支和一个运动分支,它们通过共享权重联合优化。按照这样的流程,我们研究了将训练集规模加倍(即仅视频的WebVid10M)与一些随机收集的无文本视频的效果,并欣喜地观察到性能提升(FID从9.67降至8.19,FVD从484降至441),证明了我们方法的可扩展性。我们还发现,在重新引入一些文本标签进行训练后,我们的模型可以获得可持续的性能提升(FID从8.19降至7.64,FVD从441降至366)。最后,我们在原生文本到视频生成和组合视频合成范式上验证了我们思想的有效性和泛化性。代码和模型将在https://tf-t2v.github.io/公开。

关键词

引用

@article{arxiv.2312.15770,
  title  = {A Recipe for Scaling up Text-to-Video Generation with Text-free Videos},
  author = {Xiang Wang and Shiwei Zhang and Hangjie Yuan and Zhiwu Qing and Biao Gong and Yingya Zhang and Yujun Shen and Changxin Gao and Nong Sang},
  journal= {arXiv preprint arXiv:2312.15770},
  year   = {2023}
}

备注

Project page: https://tf-t2v.github.io/