ULN:面向欠规范视觉与语言导航
计算机视觉与模式识别
2022-10-19 v1 计算与语言
摘要
视觉与语言导航(VLN)是一项利用语言指令引导具身智能体移动至目标位置的任务。尽管性能已有显著提升,但细粒度指令的广泛使用未能刻画现实中更实用的语言变化。为弥补这一不足,我们引入了一种新设定,即欠规范视觉与语言导航(ULN),以及相应的评测数据集。ULN 使用多级欠规范指令而非纯粹的细粒度或粗粒度指令来评估智能体,这是一种更真实且通用的设定。作为迈向 ULN 的初步步骤,我们提出了一种由分类模块、导航智能体和利用到探索(E2E)模块组成的 VLN 框架。具体而言,我们提出为智能体学习粒度特定子网络(GSS),以最少的额外参数来 grounding 多级指令。随后,我们的 E2E 模块估计 grounding 不确定性并进行多步前瞻探索,以进一步提高成功率。实验结果表明,现有 VLN 模型对多级语言欠规范仍较为脆弱。我们的框架更鲁棒,并在 ULN 上以约 10% 的相对成功率优于所有层级的基线。
引用
@article{arxiv.2210.10020,
title = {ULN: Towards Underspecified Vision-and-Language Navigation},
author = {Weixi Feng and Tsu-Jui Fu and Yujie Lu and William Yang Wang},
journal= {arXiv preprint arXiv:2210.10020},
year = {2022}
}
备注
EMNLP 2022