MIMO 即你所需:一种用于视频预测的强多输入多输出基线
计算机视觉与模式识别
2023-05-31 v3
摘要
现有视频预测方法的主流基于单输入单输出(SISO)架构构建模型,该架构以当前帧为输入并以递归方式预测下一帧。这种方式在尝试外推更长时间段的未来时往往导致严重的性能退化,从而限制了预测模型的实际使用。相比之下,多输入多输出(MIMO)架构一次性输出所有未来帧,天然打破了递归方式,因此防止了误差累积。然而,仅有少数用于视频预测的 MIMO 模型被提出,且由于提出时间较早它们仅取得较差的性能。MIMO 模型在该领域的真正优势未被充分关注且很大程度上未被探索。受此启发,我们在本文中进行了全面研究,以彻底探究一个简单的 MIMO 架构能走多远。令人惊讶的是,我们的实证研究表明,一个简单的 MIMO 模型可以大幅超出预期地以很大优势超越 SOTA 工作,尤其是在处理长期误差累积方面。在探索了多种方法和设计后,我们提出了一种基于扩展纯 Transformer 与局部时空块以及一种新的多输出解码器的新 MIMO 架构,即 MIMO-VP,以在视频预测中建立新标准。我们在四个极具竞争力的基准(Moving MNIST、Human3.6M、Weather、KITTI)上评估了我们的模型。大量实验表明,我们的模型在所有基准上均获得第一名,并取得显著的性能提升,且在效率、数量和质量等各个方面均超越最佳 SISO 模型。我们相信我们的模型可以作为一个新基线,以促进视频预测任务的未来研究。代码将会公开。
引用
@article{arxiv.2212.04655,
title = {MIMO Is All You Need : A Strong Multi-In-Multi-Out Baseline for Video Prediction},
author = {Shuliang Ning and Mengcheng Lan and Yanran Li and Chaofeng Chen and Qian Chen and Xunlai Chen and Xiaoguang Han and Shuguang Cui},
journal= {arXiv preprint arXiv:2212.04655},
year = {2023}
}