中文

面向视觉语言导航的结构化场景记忆

计算机视觉与模式识别 2021-03-08 v1 人工智能

摘要

近来,众多算法被提出以应对视觉语言导航(VLN)问题,即让智能体遵循语言指令在三维环境中导航。然而,当前 VLN 智能体仅将过往经验/观测作为隐状态存于循环网络中,未能捕捉环境布局并进行长期规划。为克服这些局限,我们提出一种关键架构,称为结构化场景记忆(SSM)。它具备充分的分区性,可精确记忆导航过程中的感知内容;同时作为结构化场景表示,捕捉并解耦环境中的视觉与几何线索。SSM 具有一个收集-读取控制器,可自适应收集信息以支撑当前决策,并模拟迭代算法进行长程推理。由于 SSM 提供完整的动作空间(即地图上所有可导航地点),我们引入基于边界探索的导航决策策略以实现高效且全局的规划。在两个 VLN 数据集(即 R2R 与 R4R)上的实验结果表明,我们的方法在多项指标上达到最先进水平(state-of-the-art)。

关键词

引用

@article{arxiv.2103.03454,
  title  = {Structured Scene Memory for Vision-Language Navigation},
  author = {Hanqing Wang and Wenguan Wang and Wei Liang and Caiming Xiong and Jianbing Shen},
  journal= {arXiv preprint arXiv:2103.03454},
  year   = {2021}
}

备注

Accepted on CVPR2021; Implementation will be available at https://github.com/HanqingWangAI/SSM-VLN