中文

SignScene:无地图导航的视觉信标 grounding

机器人学 2026-02-16 v1

摘要

Navigational signs 使人类能够在不熟悉环境中无需地图即可进行导航。本工作研究机器人如何类似地利用信标进行开放世界中的无地图导航。核心挑战在于解释信标:现实世界的信标种类繁多且复杂,其抽象语义内容需要在局部 3D 场景中进行 grounding。我们将此形式化为 sign grounding,即将信标上的语义指令映射到相应场景元素和导航动作的任务。最近的视觉-语言模型(VLM)提供了完成此任务所必需的语义常识和推理能力,但对空间信息的表示方式敏感。我们提出 SignScene,一种以信标为中心的空间-语义表示,捕获导航相关场景元素和信标信息,并以有利于有效推理的形式呈现给 VLM。我们在跨越九种多样化环境类型的 114 个查询数据集上评估了 grounding 方法,实现了 88% 的 grounding 准确率,显著优于基线方法。最后,我们演示了它可用于基于 Spot 机器人进行真实世界无地图导航,仅使用信标即可。

关键词

引用

@article{arxiv.2602.12686,
  title  = {SignScene: Visual Sign Grounding for Mapless Navigation},
  author = {Nicky Zimmerman and Joel Loo and Benjamin Koh and Zishuo Wang and David Hsu},
  journal= {arXiv preprint arXiv:2602.12686},
  year   = {2026}
}

备注

Under review for a conference