中文

通过语义更丰富的指令弥合视觉语言导航中的视觉鸿沟

计算机视觉与模式识别 2022-10-28 v1

摘要

视觉与语言导航(VLN)任务要求仅利用视觉信息理解文本指令以在自然室内环境中导航。尽管这对大多数人而言是微不足道的任务,但对人工智能模型来说仍是一个开放问题。在本工作中,我们假设当前模型性能低下的核心原因在于对可用视觉信息的利用不足。为支持该假设,我们提供了实验证据,表明最先进模型在仅接收有限甚至无视觉数据时受到的影响并不严重,这说明其对文本指令存在严重的过拟合。为鼓励更合理地利用视觉信息,我们提出了一种新的数据增强方法,促使在生成文本导航指令时纳入更明确的视觉信息。我们的主要直觉在于,当前 VLN 数据集所包含的文本指令旨在告知专家导航者(如人类),而非初学视觉导航智能体(如随机初始化的深度学习模型)。具体而言,为弥合当前 VLN 数据集的视觉语义鸿沟,我们利用了 Matterport3D 数据集可用的元数据,其中包括场景中存在的物体标签等信息。使用这组新指令训练最先进模型,其在未见环境中的成功率提升了 8%,证明了所提数据增强方法的优势。

关键词

引用

@article{arxiv.2210.15565,
  title  = {Bridging the visual gap in VLN via semantically richer instructions},
  author = {Joaquin Ossandón and Benjamin Earle and Álvaro Soto},
  journal= {arXiv preprint arXiv:2210.15565},
  year   = {2022}
}

备注

Accepted in ECCV 2022. Research completed on November 21, 2021