从单预测空间到多预测空间:利用多层次预测空间进行视频预测
计算机视觉与模式识别
2021-07-22 v1
摘要
尽管视频预测近年来已被广泛研究,现有工作的主流仍将其模型局限于单一预测空间,而完全忽视了利用多预测空间的方法。本工作填补了这一空白。我们首次深入研究了多种在多重预测空间中进行视频预测并将其结果融合以提升性能的策略。像素空间中的预测通常缺乏保留视频语义和结构内容的能力,而高层特征空间中的预测易于在降维和恢复过程中产生误差。因此,我们在不同特征空间之间建立循环连接,并在上采样过程中融合它们的生成结果。令人惊讶的是,这一简单想法带来了比 PhyDNet 显著得多的性能提升(在 MNIST-2 数据集上 MAE 提升 32.1%,在 KTH 数据集上提升 21.4%)。在四个数据集上的定性和定量评估均证明了我们方法的泛化能力与有效性。我们表明,我们的模型显著减少了恼人的畸变和模糊伪影,并为长期视频预测精度带来了显著改进。代码将很快发布。
引用
@article{arxiv.2107.10068,
title = {From Single to Multiple: Leveraging Multi-level Prediction Spaces for Video Forecasting},
author = {Mengcheng Lan and Shuliang Ning and Yanran Li and Qian Chen and Xunlai Chen and Xiaoguang Han and Shuguang Cui},
journal= {arXiv preprint arXiv:2107.10068},
year = {2021}
}