中文

Loc4Plan:视觉语言导航中的定位再规划

计算机视觉与模式识别 2024-08-12 v1 多媒体

摘要

视觉语言导航 (VLN) 是一项具有挑战性的任务,需要智能体理解指令并在视觉环境中导航至目的地。在户外 VLN 中,保持跟踪哪些指令已完成是一个关键挑战。为缓解此问题,先前工作主要关注将自然语言 grounding 到视觉输入,但忽略了智能体空间位置信息在 grounding 过程中所发挥的关键作用。在本工作中,我们首先探讨了空间位置定位对户外 VLN grounding 的显著影响,借鉴了人类导航的思路。在实际导航场景中,在规划前往目的地的路径之前,人类通常需要弄清自己的当前位置。这一观察凸显了空间定位在导航过程中起到的关键作用。在本工作中,我们引入了一种新框架,称为定位再规划 (Loc4Plan),旨在在户外 VLN 任务中融合空间感知用于动作规划。Loc4Plan 的核心思想是,在基于相应指导进行决策规划之前执行空间定位,该框架包括一个基于块的空间定位 (BAL) 模块和一个空间感知动作规划 (SAP) 模块。具体而言,为帮助智能体在环境中感知其空间位置,我们提出学习一个位置预测器,以衡量智能体距离下一个交叉口的距离,以反映其位置,这由 BAL 模块实现。在定位过程之后,我们提出 SAP 模块将空间信息融入以 grounding 相应指导,并增强动作规划的精度。在 Touchdown 和 map2seq 数据集上进行大量实验表明,所提出的 Loc4Plan 能优于现有 SOTA 方法。

关键词

引用

@article{arxiv.2408.05090,
  title  = {Loc4Plan: Locating Before Planning for Outdoor Vision and Language Navigation},
  author = {Huilin Tian and Jingke Meng and Wei-Shi Zheng and Yuan-Ming Li and Junkai Yan and Yunong Zhang},
  journal= {arXiv preprint arXiv:2408.05090},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2203.13838 by other authors