中文

迭代视觉与语言导航

计算机视觉与模式识别 2023-12-27 v3 计算与语言 机器人学

摘要

我们提出迭代视觉与语言导航(IVLN),这是一种用于评估语言引导智能体在持久环境中随时间导航的范式。现有的视觉与语言导航(VLN)基准在每个回合开始时擦除智能体的记忆,测试的是在无先验信息下进行冷启动导航的能力。然而,已部署的机器人会在同一环境中停留很长时间。IVLN 范式通过训练和评估在由多达 100 个有序指令跟随的 Room-to-Room(R2R)回合组成的场景巡游中保持记忆的 VLN 智能体来解决这一差异,每个回合由单独的语言指令和目标路径定义。我们提出了离散与连续的迭代 Room-to-Room(IR2R)基准,各包含约 400 次巡游,分布于 80 个室内场景。我们发现,扩展高性能 transformer VLN 智能体的隐式记忆不足以应对 IVLN,但构建地图的智能体可从环境持久性中获益,这促使 VLN 中重新关注建图智能体。

关键词

引用

@article{arxiv.2210.03087,
  title  = {Iterative Vision-and-Language Navigation},
  author = {Jacob Krantz and Shurjo Banerjee and Wang Zhu and Jason Corso and Peter Anderson and Stefan Lee and Jesse Thomason},
  journal= {arXiv preprint arXiv:2210.03087},
  year   = {2023}
}

备注

Accepted by CVPR 2023