中文

具有局部-全局上下文引导的视频扩散模型

计算机视觉与模式识别 2023-06-06 v1

摘要

扩散模型已成为视频合成任务(包括预测、生成和插值)中一种强大的范式。由于计算预算的限制,现有方法通常以自回归推理流程实现条件扩散模型,其中未来片段基于相邻过去帧的分布进行预测。然而,仅来自少数先前帧的条件无法捕获全局时间一致性,导致在长期视频预测中产生不一致甚至荒谬的结果。在本文中,我们提出一种局部-全局上下文引导的视频扩散模型(LGC-VD),以捕获多感知条件,从而在条件和无条件设置下生成高质量视频。在 LGC-VD 中,UNet 由带自注意力单元的堆叠残差块实现,避免了 3D 卷积中不理想的计算成本。我们构建了一种局部-全局上下文引导策略,以捕获过去片段的多感知嵌入,从而提升未来预测的一致性。此外,我们提出了两阶段训练策略,以减轻噪声帧的影响,实现更稳定的预测。我们的实验表明,所提方法在视频预测、插值和无条件视频生成上取得了良好的性能。我们在 https://github.com/exisas/LGC-VD 发布了代码。

关键词

引用

@article{arxiv.2306.02562,
  title  = {Video Diffusion Models with Local-Global Context Guidance},
  author = {Siyuan Yang and Lu Zhang and Yu Liu and Zhizhuo Jiang and You He},
  journal= {arXiv preprint arXiv:2306.02562},
  year   = {2023}
}

备注

Accepted for publication at IJCAI 2023. To appear