中文

面向视觉-语言导航的弱监督多粒度地图学习

计算机视觉与模式识别 2022-10-17 v1

摘要

我们解决一个实用却具挑战性的问题:训练机器智能体在环境中遵循若干语言指令描述路径进行导航。指令常包含对环境物体的描述。为实现准确高效导航,构建能精确表示空间位置与环境物体语义信息的地图至关重要。然而,使机器人构建良好表示环境的地图极其困难,因为环境常涉及具多种属性的多样物体。本文中,我们提出一种多粒度地图,其同时包含物体细粒度细节(如颜色、纹理)与语义类别,以更全面表示物体。此外,我们提出一种弱监督辅助任务,要求智能体在地图上定位指令相关物体。通过该任务,智能体不仅学会为导航定位指令相关物体,也被促使学习揭示物体信息的更优地图表示。随后我们将所学地图与指令输入路点预测器以确定下一导航目标。实验结果表明,在 VLN-CE 数据集上,我们的方法在已见与未见环境中成功率分别超越最优方法 4.0% 与 4.6%。代码见 https://github.com/PeihaoChen/WS-MGMap。

关键词

引用

@article{arxiv.2210.07506,
  title  = {Weakly-Supervised Multi-Granularity Map Learning for Vision-and-Language Navigation},
  author = {Peihao Chen and Dongyu Ji and Kunyang Lin and Runhao Zeng and Thomas H. Li and Mingkui Tan and Chuang Gan},
  journal= {arXiv preprint arXiv:2210.07506},
  year   = {2022}
}

备注

Accepted by NeurIPS 2022