中文

NÜWA:面向神经视觉世界创建的视觉合成预训练

计算机视觉与模式识别 2021-11-25 v1 人工智能

摘要

本文提出了一个名为 NÜWA 的统一多模态预训练模型,该模型能够为各种视觉合成任务生成新的或操作现有的视觉数据(即图像和视频)。为了在不同场景下同时覆盖语言、图像和视频,我们设计了一个 3D Transformer 编码器-解码器框架,该框架不仅可以将视频作为 3D 数据处理,还能分别将文本和图像作为 1D 和 2D 数据进行适配。我们还提出了一种 3D 邻近注意力(3DNA)机制,以考虑视觉数据的本质特性并降低计算复杂度。我们在 8 个下游任务上评估了 NÜWA。与多个强基线模型相比,NÜWA 在文本到图像生成、文本到视频生成、视频预测等任务上取得了最先进的结果。此外,它在文本引导的图像和视频操作任务上也展现出了令人惊讶的良好零样本能力。项目仓库地址为 https://github.com/microsoft/NUWA。

关键词

引用

@article{arxiv.2111.12417,
  title  = {N\"UWA: Visual Synthesis Pre-training for Neural visUal World creAtion},
  author = {Chenfei Wu and Jian Liang and Lei Ji and Fan Yang and Yuejian Fang and Daxin Jiang and Nan Duan},
  journal= {arXiv preprint arXiv:2111.12417},
  year   = {2021}
}