中文

视频扩散模型综述

计算机视觉与模式识别 2024-09-17 v2 人工智能 机器学习

摘要

近期人工智能生成内容(AIGC)的浪潮在计算机视觉领域取得了实质性成功,其中扩散模型在这一成就中发挥了关键作用。由于其令人印象深刻的生成能力,扩散模型正逐渐取代基于 GAN 和自回归 Transformer 的方法,不仅在图像生成与编辑中展现出卓越性能,在视频相关研究领域中也是如此。然而,现有综述主要关注图像生成背景下的扩散模型,鲜有对其在视频领域应用的及时回顾。为弥补此缺口,本文对 AIGC 时代的视频扩散模型进行了全面综述。具体而言,我们首先简要介绍扩散模型的基础与演进。随后,我们概述视频领域扩散模型的研究,将工作分为三个关键领域:视频生成、视频编辑及其他视频理解任务。我们对这三个关键领域的文献进行了深入回顾,包括进一步的分类与该领域的实际贡献。最后,我们讨论了该领域研究面临的挑战并勾勒出潜在的未来发展趋势。本综述研究的视频扩散模型完整列表见 https://github.com/ChenHsing/Awesome-Video-Diffusion-Models。

关键词

引用

@article{arxiv.2310.10647,
  title  = {A Survey on Video Diffusion Models},
  author = {Zhen Xing and Qijun Feng and Haoran Chen and Qi Dai and Han Hu and Hang Xu and Zuxuan Wu and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2310.10647},
  year   = {2024}
}