中文

用于未来流嵌入视频预测的对偶运动 GAN

计算机视觉与模式识别 2017-08-04 v2

摘要

视频中的未来帧预测是无监督视频表示学习的一个有前景的方向。视频帧是由视频中基于外观和运动动态的、来自前一帧的固有像素流自然生成的。然而,现有方法侧重于直接幻觉像素值,导致预测模糊。在本文中,我们开发了一种对偶运动生成对抗网络(GAN)架构,该架构通过双重学习机制学习显式地强制未来帧预测与视频中的逐像素流保持一致。原始的未来帧预测与对偶的未来流预测形成一个闭环,相互生成信息丰富的反馈信号以实现更好的视频预测。为了使合成的未来帧和流均难以与真实情况区分,提出了一种对偶对抗训练方法,以确保未来流预测能够帮助推断逼真的未来帧,而未来帧预测反过来又导出逼真的光流。我们的对偶运动 GAN 还使用基于变分自编码器的新型概率运动编码器来处理不同像素位置处的自然运动不确定性。大量实验表明,所提出的对偶运动 GAN 在合成新视频帧和预测未来流方面显著优于现有方法。我们的模型在不同视觉场景中具有良好的泛化能力,并在无监督视频表示学习中展现出优越性。

关键词

引用

@article{arxiv.1708.00284,
  title  = {Dual Motion GAN for Future-Flow Embedded Video Prediction},
  author = {Xiaodan Liang and Lisa Lee and Wei Dai and Eric P. Xing},
  journal= {arXiv preprint arXiv:1708.00284},
  year   = {2017}
}

备注

ICCV 17 camera ready