面向视觉语言导航的结构化场景记忆
计算机视觉与模式识别
2021-03-08 v1 人工智能
摘要
近来,众多算法被提出以应对视觉语言导航(VLN)问题,即让智能体遵循语言指令在三维环境中导航。然而,当前 VLN 智能体仅将过往经验/观测作为隐状态存于循环网络中,未能捕捉环境布局并进行长期规划。为克服这些局限,我们提出一种关键架构,称为结构化场景记忆(SSM)。它具备充分的分区性,可精确记忆导航过程中的感知内容;同时作为结构化场景表示,捕捉并解耦环境中的视觉与几何线索。SSM 具有一个收集-读取控制器,可自适应收集信息以支撑当前决策,并模拟迭代算法进行长程推理。由于 SSM 提供完整的动作空间(即地图上所有可导航地点),我们引入基于边界探索的导航决策策略以实现高效且全局的规划。在两个 VLN 数据集(即 R2R 与 R4R)上的实验结果表明,我们的方法在多项指标上达到最先进水平(state-of-the-art)。
引用
@article{arxiv.2103.03454,
title = {Structured Scene Memory for Vision-Language Navigation},
author = {Hanqing Wang and Wenguan Wang and Wei Liang and Caiming Xiong and Jianbing Shen},
journal= {arXiv preprint arXiv:2103.03454},
year = {2021}
}
备注
Accepted on CVPR2021; Implementation will be available at https://github.com/HanqingWangAI/SSM-VLN