中文

用 VQVAE 预测视频

计算机视觉与模式识别 2021-03-03 v1 机器学习

摘要

近年来,视频预测——给定过往视频帧预测未来视频——任务引起了研究界的关注。本文我们提出一种基于向量量化变分自编码器(VQ-VAE)的该问题新方案。利用 VQ-VAE,我们将高分辨率视频压缩为一组分层的多尺度离散潜变量。与像素相比,该压缩潜空间维度急剧降低,使我们能够应用可扩展的自回归生成模型来预测视频。不同于先前主要强调高度受限数据集的工作,我们聚焦于如 Kinetics-600 等非常多样的大规模数据集。我们在无约束视频上以比所知其他任何方法都更高的分辨率 256x256 预测视频。我们进一步通过众包人工评估对照先前工作验证了我们的方法。

关键词

引用

@article{arxiv.2103.01950,
  title  = {Predicting Video with VQVAE},
  author = {Jacob Walker and Ali Razavi and Aäron van den Oord},
  journal= {arXiv preprint arXiv:2103.01950},
  year   = {2021}
}

备注

13 Pages