STOVE: 用于视频建模与规划的结构化物体感知物理预测
机器学习
2020-02-13 v2 计算机视觉与模式识别
机器学习
摘要
当人类观察一个物理系统时, 他们可以轻易地定位物体、理解其相互作用并预测未来行为, 即使在具有复杂且前所未见相互作用的设置中也是如此。然而对于计算机而言, 从无监督方式中从视频学习此类模型是一个尚未解决的研究问题。在本文中, 我们提出 STOVE, 一种用于视频的新型状态空间模型, 它显式地推理物体及其位置、速度和相互作用。它通过以组合方式结合图像模型与动力学模型构建, 并通过重用动力学模型进行推断改进了先前工作, 从而加速并正则化训练。STOVE 在数百个时间步上以令人信服的物理行为预测视频, 优于先前的无监督模型, 甚至接近有监督基线的性能。我们进一步展示了我们的模型作为模拟器在具有重度相互作用物体的任务中进行样本高效基于模型控制的优势。
引用
@article{arxiv.1910.02425,
title = {Structured Object-Aware Physics Prediction for Video Modeling and Planning},
author = {Jannik Kossen and Karl Stelzner and Marcel Hussing and Claas Voelcker and Kristian Kersting},
journal= {arXiv preprint arXiv:1910.02425},
year = {2020}
}
备注
Published as a conference paper at 2020 International Conference for Learning Representations