中文

MMVP:基于运动矩阵的视频预测

计算机视觉与模式识别 2023-09-01 v2

摘要

视频预测的核心挑战在于系统必须从图像帧推断物体未来运动,同时保持其外观在帧间的一致性。本文提出一个端到端可训练的双流视频预测框架——基于运动矩阵的视频预测(MMVP),以应对该挑战。与以往通常在同一组模块中处理运动预测与外观保持的方法不同,MMVP通过构建与外观无关的运动矩阵来解耦运动与外观信息。运动矩阵表示输入帧中每对特征块的时间相似性,并且是MMVP中运动预测模块的唯一输入。该设计在准确率和效率上均改善了视频预测,并减小了模型规模。大量实验结果表明,MMVP在公开数据集上以显著更小的模型规模(大小为84%或更小)大幅优于最先进系统(约1 dB的PSNR提升,UCF Sports)。

关键词

引用

@article{arxiv.2308.16154,
  title  = {MMVP: Motion-Matrix-based Video Prediction},
  author = {Yiqi Zhong and Luming Liang and Ilya Zharkov and Ulrich Neumann},
  journal= {arXiv preprint arXiv:2308.16154},
  year   = {2023}
}

备注

ICCV 2023 (Oral)