哪边是“右”?:揭示视觉与语言导航模型的局限性
计算机视觉与模式识别
2023-12-04 v1 人工智能
摘要
视觉与语言导航(VLN)这一极具挑战性的任务要求具身智能体遵循自然语言指令到达目标位置或物体(例如“沿走廊走并在钢琴处左转”)。智能体要成功完成该任务,必须能够将指令中提及的物体(如“钢琴”) grounding到视觉场景中,并将方向性短语(如“左转”) grounding为动作。在本工作中我们提出如下问题——空间与方向性语言线索在多大程度上影响着导航模型的决策?我们提出一系列简单的掩码实验来检视模型对指令不同部分的依赖。令人惊讶地,我们发现某些顶尖模型仅依赖指令中的名词词元。我们提出两种训练方法来缓解这一令人担忧的局限性。
引用
@article{arxiv.2312.00151,
title = {Which way is `right'?: Uncovering limitations of Vision-and-Language Navigation model},
author = {Meera Hahn and Amit Raj and James M. Rehg},
journal= {arXiv preprint arXiv:2312.00151},
year = {2023}
}