中文

ULN:面向欠规范视觉与语言导航

计算机视觉与模式识别 2022-10-19 v1 计算与语言

摘要

视觉与语言导航(VLN)是一项利用语言指令引导具身智能体移动至目标位置的任务。尽管性能已有显著提升,但细粒度指令的广泛使用未能刻画现实中更实用的语言变化。为弥补这一不足,我们引入了一种新设定,即欠规范视觉与语言导航(ULN),以及相应的评测数据集。ULN 使用多级欠规范指令而非纯粹的细粒度或粗粒度指令来评估智能体,这是一种更真实且通用的设定。作为迈向 ULN 的初步步骤,我们提出了一种由分类模块、导航智能体和利用到探索(E2E)模块组成的 VLN 框架。具体而言,我们提出为智能体学习粒度特定子网络(GSS),以最少的额外参数来 grounding 多级指令。随后,我们的 E2E 模块估计 grounding 不确定性并进行多步前瞻探索,以进一步提高成功率。实验结果表明,现有 VLN 模型对多级语言欠规范仍较为脆弱。我们的框架更鲁棒,并在 ULN 上以约 10% 的相对成功率优于所有层级的基线。

关键词

引用

@article{arxiv.2210.10020,
  title  = {ULN: Towards Underspecified Vision-and-Language Navigation},
  author = {Weixi Feng and Tsu-Jui Fu and Yujie Lu and William Yang Wang},
  journal= {arXiv preprint arXiv:2210.10020},
  year   = {2022}
}

备注

EMNLP 2022