中文

投影隐空间中的视频概率扩散模型

计算机视觉与模式识别 2023-03-31 v2 机器学习

摘要

尽管深度生成模型取得了显著进展,由于视频的高维性、复杂的时间动态以及巨大的空间变化,合成高分辨率且时间连贯的视频仍然是一项挑战。近期关于扩散模型的工作已显示出解决该挑战的潜力,但它们存在严重的计算和内存低效问题,限制了可扩展性。为处理此问题,我们提出了一种新颖的视频生成模型,称为投影隐视频扩散模型(PVDM),这是一种概率扩散模型,在低维隐空间中学习视频分布,从而能在有限资源下高效训练高分辨率视频。具体而言,PVDM 由两部分组成:(a) 一个自编码器,将给定视频投影为 2D 形状的隐向量,分解视频像素的复杂立方结构;(b) 一种专为我们的新分解隐空间设计的扩散模型架构,以及训练/采样过程,可用单一模型合成任意长度的视频。在流行视频生成数据集上的实验证明了 PVDM 相较于先前视频合成方法的优越性;例如,PVDM 在 UCF-101 长视频(128 帧)生成基准上获得 639.7 的 FVD 分数,优于先前最优的 1773.4。

关键词

引用

@article{arxiv.2302.07685,
  title  = {Video Probabilistic Diffusion Models in Projected Latent Space},
  author = {Sihyun Yu and Kihyuk Sohn and Subin Kim and Jinwoo Shin},
  journal= {arXiv preprint arXiv:2302.07685},
  year   = {2023}
}

备注

CVPR 2023. Project page: https://sihyun.me/PVDM