MOSO:用于视频预测的运动的运动、场景与物体分解框架
计算机视觉与模式识别
2023-03-17 v2
摘要
运动、场景和物体是视频的三个主要视觉组成部分。具体而言,物体代表前景,场景代表背景,运动刻画其动态。基于该洞见,我们提出一种两阶段运动、场景与物体分解框架(MOSO)用于视频预测,由MOSO-VQVAE和MOSO-Transformer组成。在第一阶段,MOSO-VQVAE将先前视频片段分解为运动、场景和物体分量,并将它们表示为不同的离散令牌组。然后,在第二阶段,MOSO-Transformer基于先前令牌预测后续视频片段的物体和场景令牌,并在令牌级别向生成的物体和场景令牌添加动态运动。我们的框架可轻松扩展至无条件视频生成和视频帧插值任务。实验结果表明,我们的方法在五个具有挑战性的视频预测与无条件视频生成基准上取得了新的最先进性能:BAIR、RoboNet、KTH、KITTI和UCF101。此外,MOSO可通过组合来自不同视频的物体与场景生成逼真视频。
引用
@article{arxiv.2303.03684,
title = {MOSO: Decomposing MOtion, Scene and Object for Video Prediction},
author = {Mingzhen Sun and Weining Wang and Xinxin Zhu and Jing Liu},
journal= {arXiv preprint arXiv:2303.03684},
year = {2023}
}
备注
Accepted by CVPR 2023