Memory-Maze:面向引导盲人的场景驱动视觉语言导航基准
机器人学
2026-01-29 v2
摘要
由视觉语言导航 (VLN) 驱动的机器人有望通过理解由视力障碳者提供的路线指令来指导盲人。这一能力使机器人能够在先验未知的环境中运行。现有的 VLN 模型不足以满足盲人导航指导的场景,因为它们需要理解来自人类记忆描述的路线,这些路线经常包含顿挫、错误和细节遗漏,与在 R2R 数据集中所获得的“大声思考”式指令不同。然而,现有的基准数据集不包含来自人类记忆的指令。为此,我们提出了我们的基准,Memory-Maze,模拟寻求路线指令以指导盲人的场景。我们的基准包含类似迷宫的结构的虚拟环境和来自人类记忆的新型路线指令数据。我们的分析表明,来自记忆的指令数据更长且包含更为多样的措辞。我们进一步通过对 state-of-the-art 模型和我们的基线模型(采用模块化感知和控制)进行评估,表明了从记忆中获取的指令中处理错误和歧义的挑战之处。
引用
@article{arxiv.2405.07060,
title = {Memory-Maze: Scenario Driven Visual Language Navigation Benchmark for Guiding Blind People},
author = {Masaki Kuribayashi and Kohei Uehara and Allan Wang and Daisuke Sato and Simon Chu and Shigeo Morishima},
journal= {arXiv preprint arXiv:2405.07060},
year = {2026}
}