ShapeStacks:面向广义物体堆叠的基于视觉的物理直觉学习
计算机视觉与模式识别
2018-07-09 v2
摘要
物理直觉对于智能体执行复杂任务至关重要。在本文中,我们研究在广义物体堆叠背景下物理原理直觉性理解的被动习得及其主动利用。为此,我们提供:一个基于仿真的数据集,包含 20,000 个由多种基本几何基元组成的堆叠配置,并针对语义与结构稳定性进行了丰富标注。我们在 ShapeStacks 数据上训练用于二值稳定性预测的视觉分类器,并审视它们学到的物理直觉。由于训练数据的丰富性,我们的方法对真实场景也具有良好的泛化能力,在公开可用的积木塔基准上取得了最先进的稳定性预测。随后我们利用模型学到的物理直觉主动构建稳定堆叠,并观察到由主动堆叠任务引发的直觉性可堆叠概念——一种内在的物体可供性——的出现。即使在极具挑战的条件下(如远超训练时所见堆叠高度,或初始不稳定结构须通过配重得以稳定的情况),我们的方法仍表现良好。
引用
@article{arxiv.1804.08018,
title = {ShapeStacks: Learning Vision-Based Physical Intuition for Generalised Object Stacking},
author = {Oliver Groth and Fabian B. Fuchs and Ingmar Posner and Andrea Vedaldi},
journal= {arXiv preprint arXiv:1804.08018},
year = {2018}
}
备注
revised version to appear at ECCV 2018