姿态知晓:通过生成姿态未来实现视频预测
计算机视觉与模式识别
2017-05-02 v1
摘要
当前视频预测方法试图使用生成对抗网络(GANs)或变分自编码器(VAEs)直接在像素空间生成视频。然而,由于这些方法试图一次性对所有结构和场景动态进行建模,在非受限设定下往往生成难以解释的结果。我们的见解是在更高抽象层次上对预测问题建模。具体而言,我们利用人体姿态检测器作为免费的监管来源,将视频预测问题拆分为两个离散步骤。首先,我们显式建模场景中活动对象——人——的高层结构,并使用VAE在姿态空间中建模人体可能的未来运动。然后,我们将生成的未来姿态作为条件信息输入给GAN,以在像素空间中预测视频的未来帧。通过使用结构化的姿态空间作为中间表示,我们规避了GAN直接生成视频像素时遇到的问题。我们通过定量与定性评估表明,我们的方法在视频预测上优于最先进的方法。
引用
@article{arxiv.1705.00053,
title = {The Pose Knows: Video Forecasting by Generating Pose Futures},
author = {Jacob Walker and Kenneth Marino and Abhinav Gupta and Martial Hebert},
journal= {arXiv preprint arXiv:1705.00053},
year = {2017}
}
备注
Project Website: http://www.cs.cmu.edu/~jcwalker/POS/POS.html