MMVP:基于运动矩阵的视频预测
计算机视觉与模式识别
2023-09-01 v2
摘要
视频预测的核心挑战在于系统必须从图像帧推断物体未来运动,同时保持其外观在帧间的一致性。本文提出一个端到端可训练的双流视频预测框架——基于运动矩阵的视频预测(MMVP),以应对该挑战。与以往通常在同一组模块中处理运动预测与外观保持的方法不同,MMVP通过构建与外观无关的运动矩阵来解耦运动与外观信息。运动矩阵表示输入帧中每对特征块的时间相似性,并且是MMVP中运动预测模块的唯一输入。该设计在准确率和效率上均改善了视频预测,并减小了模型规模。大量实验结果表明,MMVP在公开数据集上以显著更小的模型规模(大小为84%或更小)大幅优于最先进系统(约1 dB的PSNR提升,UCF Sports)。
引用
@article{arxiv.2308.16154,
title = {MMVP: Motion-Matrix-based Video Prediction},
author = {Yiqi Zhong and Luming Liang and Ilya Zharkov and Ulrich Neumann},
journal= {arXiv preprint arXiv:2308.16154},
year = {2023}
}
备注
ICCV 2023 (Oral)