中文

学习分解与解耦表示以进行视频预测

机器学习 2018-10-19 v2 计算机视觉与模式识别 机器学习

摘要

我们的目标是在给定输入帧序列的情况下预测未来的视频帧。尽管有大量的视频数据,这仍是一项具有挑战性的任务,因为视频帧具有高维特性。我们通过提出分解式解耦预测自编码器(DDPAE)这一框架来应对该挑战,该框架结合结构化概率模型与深度网络,自动地(i)将我们旨在预测的高维视频分解为若干组件,以及(ii)解耦每个组件以具有更易预测的低维时间动态。关键在于,借助恰当指定的视频帧生成模型,我们的 DDPAE 能够在无显式监督的情况下学习到潜在的分解与解耦。对于 Moving MNIST 数据集,我们展示了 DDPAE 能够像我们直观上所做的那样恢复底层组件(单个数字)与解耦(外观与位置)。我们进一步证明,DDPAE 可应用于涉及多个物体间复杂交互的 Bouncing Balls 数据集,直接从像素预测视频帧并在无显式监督下恢复物理状态。

关键词

引用

@article{arxiv.1806.04166,
  title  = {Learning to Decompose and Disentangle Representations for Video Prediction},
  author = {Jun-Ting Hsieh and Bingbin Liu and De-An Huang and Li Fei-Fei and Juan Carlos Niebles},
  journal= {arXiv preprint arXiv:1806.04166},
  year   = {2018}
}