GODIVA:从自然语言描述生成开放域视频
计算机视觉与模式识别
2021-05-03 v1
摘要
从文本生成视频是一项具有挑战性的任务,因其训练的高计算需求以及评估的无限可能答案。现有工作通常在简单或小规模数据集上实验,泛化能力相当有限。本工作中,我们提出 GODIVA,一种开放域文本到视频预训练模型,可使用三维稀疏注意力机制以自回归方式从文本生成视频。我们在 Howto100M 上预训练我们的模型,这是一个包含超过 1.36 亿文本-视频对的大规模文本-视频数据集。实验表明,GODIVA 不仅可在下游视频生成任务上微调,还对未见文本具有良好的零样本能力。我们还提出一种称为相对匹配(RM)的新指标来自动评估视频生成质量。若干挑战被列出并作为未来工作讨论。
引用
@article{arxiv.2104.14806,
title = {GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions},
author = {Chenfei Wu and Lun Huang and Qianxi Zhang and Binyang Li and Lei Ji and Fan Yang and Guillermo Sapiro and Nan Duan},
journal= {arXiv preprint arXiv:2104.14806},
year = {2021}
}