中文

连续环境中视觉与语言导航的基于图的环境表示

计算机视觉与模式识别 2023-01-12 v1 人工智能 机器人学

摘要

连续环境中的视觉与语言导航(VLN-CE)是一项要求智能体在真实环境中遵循语言指令的导航任务。环境理解是 VLN-CE 任务的关键部分,但现有方法在环境理解上相对简单直接,未深入探究语言指令与视觉环境之间的关系。因此,我们提出一种新的环境表示以解决上述问题。首先,我们通过目标检测提出环境表示图(ERG)以在语义层面表达环境,该操作增强了语言与环境之间的关系。然后,通过 GCN 学习 ERG 中目标-目标、目标-智能体的关系表示,从而获得关于 ERG 的连续表达。随后,我们将 ERG 表达与目标标签嵌入相结合以获得环境表示。最后,提出一种新的跨模态注意力导航框架,融合我们的环境表示和专用于训练 ERG 的特殊损失函数。实验结果表明,我们的方法在 VLN-CE 任务的成功率方面取得了令人满意的性能。进一步分析表明,我们的方法实现了更好的跨模态匹配和较强的泛化能力。

关键词

引用

@article{arxiv.2301.04352,
  title  = {Graph based Environment Representation for Vision-and-Language Navigation in Continuous Environments},
  author = {Ting Wang and Zongkai Wu and Feiyu Yao and Donglin Wang},
  journal= {arXiv preprint arXiv:2301.04352},
  year   = {2023}
}

备注

10 pages, 5 figures