中文

NAVCON:面向视觉与语言导航的认知启发与语言学 grounded 语料库

计算与语言 2024-12-19 v2 计算机视觉与模式识别

摘要

我们提出了 NAVCON,一个构建在两个流行数据集(R2R 和 RxR)之上的大规模标注视觉语言导航(VLN)语料库。本文引入了四个核心的、受认知动机驱动且具有语言学 grounded 的导航概念,以及一种用于生成这些概念在导航指令中自然语言实现的规模化银标注的算法。我们将标注的指令与智能体执行这些指令的视频片段配对。NAVCON 包含约 30,0000 条指令的 236,316 个概念标注,以及约 19,000 条指令对应的 270 万张对齐图像,展示了智能体在执行指令时所看到的内容。据我们所知,这是首个关于导航概念的综合资源。我们通过对 NAVCON 样本进行人工评估研究,评估了银标注的质量。作为对该资源质量和有用性的进一步验证,我们训练了一个模型来检测未见指令中的导航概念及其语言实现。此外,我们展示了使用 NAVCON 的大规模银标注,GPT-4o 在此任务上的少样本学习表现良好。

关键词

引用

@article{arxiv.2412.13026,
  title  = {NAVCON: A Cognitively Inspired and Linguistically Grounded Corpus for Vision and Language Navigation},
  author = {Karan Wanchoo and Xiaoye Zuo and Hannah Gonzalez and Soham Dan and Georgios Georgakis and Dan Roth and Kostas Daniilidis and Eleni Miltsakaki},
  journal= {arXiv preprint arXiv:2412.13026},
  year   = {2024}
}