中文

NUWA-XL:用于极长视频生成的扩散套扩散架构

计算机视觉与模式识别 2023-03-23 v1 人工智能

摘要

在本文中,我们提出 NUWA-XL,一种用于极长视频生成的新型扩散套扩散(Diffusion over Diffusion)架构。当前大多数工作逐段顺序生成长视频,这通常导致在短视频上训练与在长视频上推断之间的鸿沟,且顺序生成效率低下。相反,我们的方法采用“由粗到细”的过程,其中视频可在同一粒度上并行生成。应用一个全局扩散模型生成整个时间范围内的关键帧,然后局部扩散模型递归地填充邻近帧之间的内容。这一简单而有效的策略使我们能够直接在长视频(3376 帧)上训练以减小训练-推断鸿沟,并使所有片段并行生成成为可能。为评估我们的模型,我们构建了 FlintstonesHD 数据集,一个长视频生成的新基准。实验表明,我们的模型不仅生成具有全局与局部一致性的高质量长视频,而且在相同硬件设置下生成 1024 帧时,将平均推断时间从 7.55 分钟降至 26 秒(降低 94.26%)。主页链接为 \url{https://msra-nuwa.azurewebsites.net/}

关键词

引用

@article{arxiv.2303.12346,
  title  = {NUWA-XL: Diffusion over Diffusion for eXtremely Long Video Generation},
  author = {Shengming Yin and Chenfei Wu and Huan Yang and Jianfeng Wang and Xiaodong Wang and Minheng Ni and Zhengyuan Yang and Linjie Li and Shuguang Liu and Fan Yang and Jianlong Fu and Gong Ming and Lijuan Wang and Zicheng Liu and Houqiang Li and Nan Duan},
  journal= {arXiv preprint arXiv:2303.12346},
  year   = {2023}
}