长视频的灵活扩散建模
计算机视觉与模式识别
2022-12-19 v3 机器学习
摘要
我们提出一种基于去噪扩散概率模型的视频建模框架,可在多种真实环境中生成长时长的视频补全。我们引入一种生成模型,可在测试时以任意其他帧子集为条件采样任意指定的视频帧子集,并给出为此目的适配的架构。如此一来,我们得以高效比较并优化长视频中帧采样顺序的多种调度方案,并对已采样帧使用选择性的稀疏与长距离条件化。我们在多个数据集上展示了优于先前工作的视频建模效果,并采样出时长超过 25 分钟的时间连贯视频。此外,我们发布了一个新的视频建模数据集以及基于 CARLA 自动驾驶模拟器生成视频的语义有意义度量指标。
引用
@article{arxiv.2205.11495,
title = {Flexible Diffusion Modeling of Long Videos},
author = {William Harvey and Saeid Naderiparizi and Vaden Masrani and Christian Weilbach and Frank Wood},
journal= {arXiv preprint arXiv:2205.11495},
year = {2022}
}