投影隐空间中的视频概率扩散模型
计算机视觉与模式识别
2023-03-31 v2 机器学习
摘要
尽管深度生成模型取得了显著进展,由于视频的高维性、复杂的时间动态以及巨大的空间变化,合成高分辨率且时间连贯的视频仍然是一项挑战。近期关于扩散模型的工作已显示出解决该挑战的潜力,但它们存在严重的计算和内存低效问题,限制了可扩展性。为处理此问题,我们提出了一种新颖的视频生成模型,称为投影隐视频扩散模型(PVDM),这是一种概率扩散模型,在低维隐空间中学习视频分布,从而能在有限资源下高效训练高分辨率视频。具体而言,PVDM 由两部分组成:(a) 一个自编码器,将给定视频投影为 2D 形状的隐向量,分解视频像素的复杂立方结构;(b) 一种专为我们的新分解隐空间设计的扩散模型架构,以及训练/采样过程,可用单一模型合成任意长度的视频。在流行视频生成数据集上的实验证明了 PVDM 相较于先前视频合成方法的优越性;例如,PVDM 在 UCF-101 长视频(128 帧)生成基准上获得 639.7 的 FVD 分数,优于先前最优的 1773.4。
引用
@article{arxiv.2302.07685,
title = {Video Probabilistic Diffusion Models in Projected Latent Space},
author = {Sihyun Yu and Kihyuk Sohn and Subin Kim and Jinwoo Shin},
journal= {arXiv preprint arXiv:2302.07685},
year = {2023}
}
备注
CVPR 2023. Project page: https://sihyun.me/PVDM