VAE^2:防止真实场景下变分视频预测的后验坍缩
计算机视觉与模式识别
2021-01-29 v1
摘要
预测视频序列的未来帧由于问题的复杂与随机性而具挑战性。基于变分自编码器(VAEs)的视频预测方法已取得巨大成功,但它们要求训练数据包含观测视频序列的多种可能未来。当视频在真实场景(in the wild)中捕获时,任何给定观测仅具有确定性的未来,这难以满足。因此,用这些视频训练朴素 VAE 模型不可避免地导致后验坍缩。为缓解此问题,我们提出一种新颖的 VAE 结构,称为 VAE-in-VAE 或 VAE。其核心思想是向 VAE 中显式引入随机性。我们将部分观测视频序列视为桥接其过去与未来的随机转移状态,并在所有可能转移状态下最大化视频序列上马尔可夫链的对数似然。针对此难解目标函数提出了可处理的下界,并相应设计了端到端优化算法。VAE 能在很大程度上缓解后验坍缩问题,因为它打破了未来与观测间的直接依赖,且不直接回归训练数据提供的确定性未来。我们在名为 Cityscapes 的大规模数据集上开展实验,该数据集包含从多个城市收集的视频。结果表明,VAE 能够预测多样化未来,且比其他最先进的基于 VAE 的方法更抗后验坍缩。我们相信 VAE 也适用于其他训练数据缺乏随机性的随机序列预测问题。
引用
@article{arxiv.2101.12050,
title = {VAE^2: Preventing Posterior Collapse of Variational Video Predictions in the Wild},
author = {Yizhou Zhou and Chong Luo and Xiaoyan Sun and Zheng-Jun Zha and Wenjun Zeng},
journal= {arXiv preprint arXiv:2101.12050},
year = {2021}
}
备注
17 pages, 26 figures