中文

Kimera:从SLAM到基于三维动态场景图的空间感知

机器人学 2021-10-22 v3 计算机视觉与模式识别

摘要

人类能够对其所处环境形成一个复杂的心智模型。该心智模型捕捉场景的几何与语义方面,在多个抽象层次(例如物体、房间、建筑)上描述环境,并包含静态与动态实体及其关系(例如某人在某时刻处于某房间内)。相比之下,当前机器人的内部表示仍提供对环境的部分且碎片化的理解,要么表现为稀疏或稠密的几何基元集合(例如点、线、平面、体素),要么表现为物体集合。本文试图通过引入一种新颖的表示——三维动态场景图(DSG)来缩小机器人与人类感知之间的差距,该图无缝捕捉动态环境的度量与语义方面。DSG是一种分层图,其中节点表示不同抽象层次上的空间概念,边表示节点间的时空关系。我们的第二个贡献是Kimera,首个从视觉-惯性数据全自动构建DSG的方法。Kimera包含用于视觉-惯性SLAM、度量-语义三维重建、物体定位、人体姿态与形状估计以及场景解析的先进技术方案。我们的第三个贡献是在真实数据集和照片级真实感模拟中对Kimera进行全面评估,包括一个新发布的数据集uHumans2,其模拟了一系列拥挤的室内外场景。我们的评估表明,Kimera在视觉-惯性SLAM中达到了最先进的性能,实时估计出准确的三维度量-语义网格模型,并在数分钟内构建出包含数十个物体和人物的复杂室内环境的DSG。我们最后的贡献展示了如何使用DSG进行实时分层语义路径规划。Kimera的核心模块是开源的。

关键词

引用

@article{arxiv.2101.06894,
  title  = {Kimera: from SLAM to Spatial Perception with 3D Dynamic Scene Graphs},
  author = {Antoni Rosinol and Andrew Violette and Marcus Abate and Nathan Hughes and Yun Chang and Jingnan Shi and Arjun Gupta and Luca Carlone},
  journal= {arXiv preprint arXiv:2101.06894},
  year   = {2021}
}

备注

34 pages, 25 figures, 9 tables. arXiv admin note: text overlap with arXiv:2002.06289