中文

从无标注视频中无监督学习对象结构与动力学

计算机视觉与模式识别 2020-03-03 v3

摘要

从无监督条件下从视频中提取并预测对象结构与动力学是机器学习中的一大挑战。为应对该挑战,我们采用基于关键点的图像表示并学习关键点的随机动力学模型。未来帧由关键点与一参考帧重建。通过在关键点坐标空间中建模动力学,我们实现了稳定学习并避免了像素空间中误差的累积。我们的方法在像素级视频预测以及需要对象级运动动力学理解的下游任务上均优于非结构化表示。我们在多个多样数据集上评估了模型:多智能体体育数据集、Human3.6M 数据集,以及基于 DeepMind Control Suite 连续控制任务的数据集。该空间结构化表示在一系列运动相关任务(如对象跟踪、动作识别与奖励预测)上均优于非结构化表示。

关键词

引用

@article{arxiv.1906.07889,
  title  = {Unsupervised Learning of Object Structure and Dynamics from Videos},
  author = {Matthias Minderer and Chen Sun and Ruben Villegas and Forrester Cole and Kevin Murphy and Honglak Lee},
  journal= {arXiv preprint arXiv:1906.07889},
  year   = {2020}
}

备注

33rd Conference on Neural Information Processing Systems (NeurIPS 2019), Vancouver, Canada