SimVP:更简洁且更优的视频预测模型
计算机视觉与模式识别
2022-06-13 v1 人工智能
摘要
从 CNN、RNN 到 ViT,我们见证了视频预测领域的显著进展,其中引入了辅助输入、精细的神经网络架构和复杂的训练策略。我们赞赏这些进步,但也对其必要性感到困惑:是否存在一种简单的方法能够取得相当好的性能?本文提出 SimVP,一种完全基于 CNN 构建并以端到端方式通过 MSE 损失训练的简易视频预测模型。在不引入任何额外技巧和复杂策略的情况下,我们能在五个基准数据集上取得最先进的性能。通过扩展实验,我们证明了 SimVP 在真实世界数据集上具有强大的泛化性和可扩展性。训练成本的大幅降低使其更易于扩展到复杂场景。我们相信 SimVP 可以作为一个坚实的基线,以激励视频预测的进一步发展。代码可在 \href{https://github.com/gaozhangyang/SimVP-Simpler-yet-Better-Video-Prediction}{Github} 获取。
引用
@article{arxiv.2206.05099,
title = {SimVP: Simpler yet Better Video Prediction},
author = {Zhangyang Gao and Cheng Tan and Lirong Wu and Stan Z. Li},
journal= {arXiv preprint arXiv:2206.05099},
year = {2022}
}