面向视觉-语言导航的弱监督多粒度地图学习
计算机视觉与模式识别
2022-10-17 v1
摘要
我们解决一个实用却具挑战性的问题:训练机器智能体在环境中遵循若干语言指令描述路径进行导航。指令常包含对环境物体的描述。为实现准确高效导航,构建能精确表示空间位置与环境物体语义信息的地图至关重要。然而,使机器人构建良好表示环境的地图极其困难,因为环境常涉及具多种属性的多样物体。本文中,我们提出一种多粒度地图,其同时包含物体细粒度细节(如颜色、纹理)与语义类别,以更全面表示物体。此外,我们提出一种弱监督辅助任务,要求智能体在地图上定位指令相关物体。通过该任务,智能体不仅学会为导航定位指令相关物体,也被促使学习揭示物体信息的更优地图表示。随后我们将所学地图与指令输入路点预测器以确定下一导航目标。实验结果表明,在 VLN-CE 数据集上,我们的方法在已见与未见环境中成功率分别超越最优方法 4.0% 与 4.6%。代码见 https://github.com/PeihaoChen/WS-MGMap。
引用
@article{arxiv.2210.07506,
title = {Weakly-Supervised Multi-Granularity Map Learning for Vision-and-Language Navigation},
author = {Peihao Chen and Dongyu Ji and Kunyang Lin and Runhao Zeng and Thomas H. Li and Mingkui Tan and Chuang Gan},
journal= {arXiv preprint arXiv:2210.07506},
year = {2022}
}
备注
Accepted by NeurIPS 2022