组合式视频预测
计算机视觉与模式识别
2019-08-23 v1
摘要
我们提出了一种在给定场景输入图像的情况下进行像素级未来预测的方法。我们观察到场景由经历运动的不同实体组成,并提出了一种将这一见解付诸实践的方法。我们隐式地预测独立实体的未来状态,同时推理它们之间的交互,并利用这些预测状态合成未来的视频帧。我们使用全局轨迹级潜在随机变量克服了该任务固有的多模态性,并证明这使我们能够采样出多样且合理的未来。我们通过对比替代表示和引入多模态性的方式,对我们的方法进行了实证验证。我们考察了两个数据集,一个包含可能倾倒的堆叠物体,另一个包含人类在健身房进行活动的视频,并证明我们的方法能够在这些多样化的场景中实现逼真的随机视频预测。视频预测结果见 https://judyye.github.io/CVP/。
引用
@article{arxiv.1908.08522,
title = {Compositional Video Prediction},
author = {Yufei Ye and Maneesh Singh and Abhinav Gupta and Shubham Tulsiani},
journal= {arXiv preprint arXiv:1908.08522},
year = {2019}
}
备注
accepted to ICCV19