中文

LangMap:用于开放词汇目标导航的分层基准

计算机视觉与模式识别 2026-02-03 v1 机器人学

摘要

对象与语言之间的关系是人类与 AI 之间实现有意义沟通以及实用嵌入式智能的基础。我们引入 HieraNav,一个多粒度、开放词汇目标导航任务,其中代理人解释自然语言指令以到达四个语义层级的目标:场景、房间、区域和实例。为此,我们提出 Language as a Map (LangMap),一个建立在真实世界 3D 室内扫描上的大型基准,包含全面人工审核注释和跨这些层级的任务。LangMap 提供区域标签、判别区域描述、覆盖 414 个对象类别的判别实例描述,以及超过 18K 个导航任务。每个目标都具有简洁和详细的描述,使其能够针对不同风格的指令进行评估。LangMap 实现了优异的注释质量,相较于 GOAT-Bench 在判别准确率上提高了 23.8%,同时使用了四分之一的词数。对 LangMap 上零样本和监督模型的全面评估表明,更丰富的上下文和记忆可以提高成功率,而长尾、小规模、依赖上下文且距离较远的目标以及多目标完成仍具有挑战性。HieraNav 和 LangMap 建立了一个严格的测试平台,用于推动语言驱动的嵌入式导航。项目:https://bo-miao.github.io/LangMap

关键词

引用

@article{arxiv.2602.02220,
  title  = {LangMap: A Hierarchical Benchmark for Open-Vocabulary Goal Navigation},
  author = {Bo Miao and Weijia Liu and Jun Luo and Lachlan Shinnick and Jian Liu and Thomas Hamilton-Smith and Yuhe Yang and Zijie Wu and Vanja Videnovic and Feras Dayoub and Anton van den Hengel},
  journal= {arXiv preprint arXiv:2602.02220},
  year   = {2026}
}