GridMM:用于视觉-语言导航的网格记忆地图
计算机视觉与模式识别
2023-08-25 v4 人工智能
摘要
视觉-语言导航(VLN)使智能体能够在3D环境中遵循自然语言指令导航至远端位置。为表示先前已访问的环境,多数VLN方法使用循环状态、拓扑地图或俯视语义地图实现记忆。与这些方法不同,我们构建了俯视自我中心且动态增长的网格记忆地图(即GridMM)来结构化已访问环境。从全局视角,历史观测被投影至俯视视图中的统一网格地图,能更好表示环境的空间关系。从局部视角,我们进一步提出指令相关性聚合方法以捕获各网格区域中的细粒度视觉线索。在离散环境中的REVERIE、R2R、SOON数据集以及连续环境中的R2R-CE数据集上进行了充分实验,显示了我们所提方法的优越性。
引用
@article{arxiv.2307.12907,
title = {GridMM: Grid Memory Map for Vision-and-Language Navigation},
author = {Zihan Wang and Xiangyang Li and Jiahao Yang and Yeqi Liu and Shuqiang Jiang},
journal= {arXiv preprint arXiv:2307.12907},
year = {2023}
}
备注
Accepted by ICCV 2023. The code is available at https://github.com/MrZihan/GridMM