中文

室内环境的以物体为中心的度量-语义地图

机器人学 2026-03-11 v2

摘要

大型语言模型(LLMs)可以帮助机器人推理抽象的任务规范。这需要将机器人使用的经典环境表示(如点云和网格)与基于自然语言的先验知识相结合。现有文献中有多种方法可以实现这一点。一些导航框架利用场景级语义,但牺牲了物体级细节;其他方法如语言引导的神经辐射场(NeRFs)或分割一切3D(SAM3D)则优先考虑物体精度而非全局场景上下文。本文认为我们可以两全其美。我们使用配备RealSense立体相机(RGB-D数据)的Unitree Go2四足机器人来构建室内环境的显式度量-语义表示。这是一种场景级表示,每个物体(例如,各种形状和尺寸的椅子、沙发、门)都由详细的网格、其类别和姿态表示。我们证明,这种表示比基于基础模型的建图(如SAM3D构建的地图)以及最先进的场景级机器人建图流程(如Clio(Maggio等人,2024))更准确。我们的实现比SAM3D快约25倍,比Clio慢约10倍。我们还可以调整我们的方法以实现开放集场景级建图,即当物体网格事先未知时,通过基于SAM3D进一步改进精确率和召回率。我们展示了这种表示如何轻松地与LLMs(如Google的Gemini)一起使用,以展示场景理解、复杂推理和规划。我们还展示了这些表示在模拟仓库和医院环境中使用Nvidia的Isaac Sim进行语义导航的实用性。

关键词

引用

@article{arxiv.2510.10778,
  title  = {Asset-Centric Metric-Semantic Maps of Indoor Environments},
  author = {Christopher D. Hsu and Pratik Chaudhari},
  journal= {arXiv preprint arXiv:2510.10778},
  year   = {2026}
}

备注

9 pages, 8 figures, 3 tables