Phenaki:基于开放域文本描述的可变长度视频生成
计算机视觉与模式识别
2022-10-06 v1 人工智能
摘要
我们提出 Phenaki,一种给定文本提示序列即可进行真实视频合成的模型。由于计算成本、高质量文本-视频数据数量有限以及视频长度可变,从文本生成视频尤其具有挑战性。为应对这些问题,我们引入一种用于学习视频表示的新模型,将视频压缩为离散 token 的微小表示。该 tokenizer 在时间上采用因果注意力,从而可处理可变长度视频。为从文本生成视频 token,我们使用以预计算文本 token 为条件的双向掩码 transformer。生成的视频 token 随后被去 token 化以创建实际视频。为解决数据问题,我们展示了在大规模图像-文本对语料库以及较少视频-文本样本上的联合训练,能够带来超出视频数据集中可用内容的泛化能力。与先前的视频生成方法相比,Phenaki 可生成以提示序列(即时间可变文本或故事)为条件的任意长视频,且处于开放域。据我们所知,这是首次有论文研究从时间可变提示生成视频。此外,与逐帧基线相比,所提出的视频编码器-解码器为每个视频计算更少的 token,但带来更好的时空一致性。
引用
@article{arxiv.2210.02399,
title = {Phenaki: Variable Length Video Generation From Open Domain Textual Description},
author = {Ruben Villegas and Mohammad Babaeizadeh and Pieter-Jan Kindermans and Hernan Moraldo and Han Zhang and Mohammad Taghi Saffar and Santiago Castro and Julius Kunze and Dumitru Erhan},
journal= {arXiv preprint arXiv:2210.02399},
year = {2022}
}