中文

GODIVA:从自然语言描述生成开放域视频

计算机视觉与模式识别 2021-05-03 v1

摘要

从文本生成视频是一项具有挑战性的任务,因其训练的高计算需求以及评估的无限可能答案。现有工作通常在简单或小规模数据集上实验,泛化能力相当有限。本工作中,我们提出 GODIVA,一种开放域文本到视频预训练模型,可使用三维稀疏注意力机制以自回归方式从文本生成视频。我们在 Howto100M 上预训练我们的模型,这是一个包含超过 1.36 亿文本-视频对的大规模文本-视频数据集。实验表明,GODIVA 不仅可在下游视频生成任务上微调,还对未见文本具有良好的零样本能力。我们还提出一种称为相对匹配(RM)的新指标来自动评估视频生成质量。若干挑战被列出并作为未来工作讨论。

关键词

引用

@article{arxiv.2104.14806,
  title  = {GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions},
  author = {Chenfei Wu and Lun Huang and Qianxi Zhang and Binyang Li and Lei Ji and Fan Yang and Guillermo Sapiro and Nan Duan},
  journal= {arXiv preprint arXiv:2104.14806},
  year   = {2021}
}