用于视频预测的改进条件 VRNN
计算机视觉与模式识别
2019-04-30 v1 机器学习
摘要
预测视频序列的未来帧是一项具有挑战性的生成建模任务。有前景的方法包括变分自编码器(VAE)等概率潜变量模型。虽然 VAE 可以处理不确定性并建模多种可能的未来结果,但它们倾向于产生模糊的预测。在本文中,我们认为这是欠拟合的迹象。为解决此问题,我们提议增加潜分布的表达能力并使用更高容量的似然模型。我们的方法依赖于潜变量的层次结构,其定义了一族灵活的先验和后验分布,以更好地建模未来序列的概率。我们通过一系列消融实验验证了我们的提议,并将我们的方法与当前最先进的潜变量模型进行比较。我们的方法在三个不同数据集的若干指标下表现优异。
引用
@article{arxiv.1904.12165,
title = {Improved Conditional VRNNs for Video Prediction},
author = {Lluis Castrejon and Nicolas Ballas and Aaron Courville},
journal= {arXiv preprint arXiv:1904.12165},
year = {2019}
}
备注
Project page: https://sites.google.com/view/videovrnn