用于机器人导航的视听语言地图
机器人学
2023-03-28 v2 人工智能
计算与语言
计算机视觉与模式识别
机器学习
摘要
尽管与世界交互是一种多感官体验,许多机器人仍主要依赖视觉感知来建图并在其环境中导航。在这项工作中,我们提出视听语言地图(AVLMaps),一种用于存储来自音频、视觉和语言线索的跨模态信息的统一 3D 空间地图表示。AVLMaps 通过将多模态基础模型在互联网规模数据上预训练的特征融合到一个集中的 3D 体素网格中,集成了这些模型的开放词汇能力。在导航背景下,我们展示了 AVLMaps 使机器人系统能够基于多模态查询(例如文本描述、图像或地标的音频片段)在地图中索引目标。特别是,音频信息的加入使机器人能够更可靠地消除目标位置的歧义。仿真中的大量实验表明,AVLMaps 支持基于多模态提示的零样本多模态目标导航,并在歧义场景下提供 50% 更好的召回率。这些能力延伸到真实世界中的移动机器人——导航至涉及视觉、音频和空间概念的地标。视频和代码见:https://avlmaps.github.io。
引用
@article{arxiv.2303.07522,
title = {Audio Visual Language Maps for Robot Navigation},
author = {Chenguang Huang and Oier Mees and Andy Zeng and Wolfram Burgard},
journal= {arXiv preprint arXiv:2303.07522},
year = {2023}
}
备注
Project page: https://avlmaps.github.io/