中文

基于潜变量分层解耦表示的高效未来视频生成训练方法

计算机视觉与模式识别 2021-06-09 v2

摘要

生成预测给定序列未来情况的视频近年来一直是活跃的研究领域。然而,一个关键问题尚未解决:大多数方法在训练时需要巨大的计算成本与内存占用。本文提出一种新颖的方法,以低于传统方法的内存占用来生成未来预测视频。这是通向生成高图像质量视频(类似于图像生成最新工作中生成图像的质量)道路上的关键一步。我们通过两阶段训练实现高效性:(1)图像重建,将视频帧编码为潜变量;(2)潜变量预测,生成未来序列。我们的方法依据每帧的分层结构将其分解,从而将视频高效压缩为低维潜变量。即,我们认为视频可分离为背景与前景物体,且每个物体独立持有随时间变化与独立于时间的信息。实验表明,即便对于先前方法无法处理的复杂数据集,所提方法也能高效生成未来预测视频。

关键词

引用

@article{arxiv.2106.03502,
  title  = {Efficient training for future video generation based on hierarchical disentangled representation of latent variables},
  author = {Naoya Fushishita and Antonio Tejero-de-Pablos and Yusuke Mukuta and Tatsuya Harada},
  journal= {arXiv preprint arXiv:2106.03502},
  year   = {2021}
}