中文

通过模仿自然序列中的动力学进行视觉预测

计算机视觉与模式识别 2017-08-22 v1

摘要

我们引入一个通用的视觉预测框架,该框架直接模仿视觉序列,无需额外监督。因此,我们的模型可应用于多个语义层级,且不需要任何领域知识或手工设计的特征。我们通过将视觉预测形式化为一个逆强化学习(IRL)问题,并直接从原始像素值模仿自然序列中的动力学来实现这一点。关键挑战在于高维且连续的状态-动作空间,这阻碍了以往 IRL 算法的应用。我们通过扩展近期在无模型模仿学习方面的进展,利用可训练的深度特征表示来解决这一计算瓶颈,该方法(1)通过使用对偶形式绕过了动态规划中对状态-动作对的穷举访问,(2)通过深度特征重参数化避免了梯度计算时的显式状态采样。这使我们能够大规模应用 IRL,并直接从原始像素值模仿高维连续视觉序列中的动力学。我们在三个不同的抽象层级上评估了我们的方法,从低层像素到高层语义:未来帧生成、动作预测、视觉故事预测。在所有层级上,我们的方法均优于现有方法。

关键词

引用

@article{arxiv.1708.05827,
  title  = {Visual Forecasting by Imitating Dynamics in Natural Sequences},
  author = {Kuo-Hao Zeng and William B. Shen and De-An Huang and Min Sun and Juan Carlos Niebles},
  journal= {arXiv preprint arXiv:1708.05827},
  year   = {2017}
}

备注

10 pages, 9 figures, accepted to ICCV 2017