用于机器人导航和操控的多模态空间语言地图
摘要
将语言与导航代理的观察进行 grounding 可利用预训练的多模态基础模型来匹配感知与对象或事件描述。然而,之前的方法仍与环境映射脱节,缺乏几何地图的空间精度,或忽略视觉之外的其他模态信息。为此,我们提出多模态空间语言地图作为一种空间地图表示,融合预训练的多模态特征与环境的 3D 重建。我们使用标准探索自主构建这些地图。我们提出两种地图实例,即视觉-语言地图 (VLMaps) 及其扩展的音频-视觉-语言地图 (AVLMaps),通过添加音频信息获得。当结合大语言模型 (LLM) 时,VLMaps 可实现 (i) 将自然语言命令翻译为开放词汇空间目标(例如“在沙发和电视之间”),直接在地图中局部化;(ii) 在不同机器人机体间共享,从而按需生成定制的障碍地图。基于上述能力,AVLMaps 通过融合来自预训练多模态基础模型的特征,引入统一的 3D 空间表示,整合音频、视觉和语言线索。这使得机器人能够将多模态目标查询(例如文本、图像或音频片段)对齐到空间位置进行导航。此外,多样化感知输入的融合显著增强了在模糊环境中的目标消歧能力。仿真和真实环境中的实验表明,我们的多模态空间语言地图实现了零样本空间和多模态目标导航,并在模糊情境下提高召回率 50%。这些能力适用于移动机器人和桌面操控器,支持由视觉、音频和空间线索引导的导航和交互。
引用
@article{arxiv.2506.06862,
title = {Multimodal Spatial Language Maps for Robot Navigation and Manipulation},
author = {Chenguang Huang and Oier Mees and Andy Zeng and Wolfram Burgard},
journal= {arXiv preprint arXiv:2506.06862},
year = {2025}
}
备注
accepted to International Journal of Robotics Research (IJRR). 24 pages, 18 figures. The paper contains texts from VLMaps(arXiv:2210.05714) and AVLMaps(arXiv:2303.07522). The project page is https://mslmaps.github.io/