用 VQVAE 预测视频
计算机视觉与模式识别
2021-03-03 v1 机器学习
摘要
近年来,视频预测——给定过往视频帧预测未来视频——任务引起了研究界的关注。本文我们提出一种基于向量量化变分自编码器(VQ-VAE)的该问题新方案。利用 VQ-VAE,我们将高分辨率视频压缩为一组分层的多尺度离散潜变量。与像素相比,该压缩潜空间维度急剧降低,使我们能够应用可扩展的自回归生成模型来预测视频。不同于先前主要强调高度受限数据集的工作,我们聚焦于如 Kinetics-600 等非常多样的大规模数据集。我们在无约束视频上以比所知其他任何方法都更高的分辨率 256x256 预测视频。我们进一步通过众包人工评估对照先前工作验证了我们的方法。
引用
@article{arxiv.2103.01950,
title = {Predicting Video with VQVAE},
author = {Jacob Walker and Ali Razavi and Aäron van den Oord},
journal= {arXiv preprint arXiv:2103.01950},
year = {2021}
}
备注
13 Pages