MCVD:用于预测、生成与插值的掩码条件视频扩散
计算机视觉与模式识别
2022-10-14 v4 人工智能
机器学习
摘要
视频预测是一项具有挑战性的任务。当前最先进(SOTA)生成模型输出的视频帧质量往往较差,且难以泛化到训练数据之外。此外,现有的预测框架通常无法同时处理其他视频相关任务,如无条件生成或插值。在本工作中,我们设计了一个通用框架,称为掩码条件视频扩散(MCVD),利用基于概率条件得分的去噪扩散模型,以过去和/或未来帧为条件,来完成所有这些视频合成任务。我们以随机且独立地掩码所有过去帧或所有未来帧的方式训练模型。这一新颖而直接的设置使我们能够训练单个模型,可执行广泛的视频任务,具体而言:未来/过去预测——当仅掩码未来/过去帧时;无条件生成——当过去与未来帧均被掩码时;以及插值——当过去与未来帧均未被掩码时。我们的实验表明,该方法能为各类视频生成高质量帧。我们的 MCVD 模型由简单的非循环 2D 卷积架构构建,以帧块为条件并生成帧块。我们以自回归的块方式生成任意长度的视频。我们的方法在标准视频预测与插值基准上取得了 SOTA 结果,模型训练的计算时间在 4 块 GPU 下为 1-12 天。项目页面:https://mask-cond-video-diffusion.github.io ;代码:https://github.com/voletiv/mcvd-pytorch
引用
@article{arxiv.2205.09853,
title = {MCVD: Masked Conditional Video Diffusion for Prediction, Generation, and Interpolation},
author = {Vikram Voleti and Alexia Jolicoeur-Martineau and Christopher Pal},
journal= {arXiv preprint arXiv:2205.09853},
year = {2022}
}
备注
NeurIPS 2022 ; 10 pages, 4 figures, 7 tables