中文

导航细微差异:面向视觉语言导航的细粒度评估

计算机视觉与模式识别 2024-09-27 v1 人工智能 计算与语言

摘要

本研究提出了一种新的评估框架,用于视觉语言导航(VLN)任务。旨在对当前模型在各种指令类别方面的表现进行更细致的诊断。该框架基于任务的上下文无关语法(CFG)构建。CFG是问题分解和指令类别设计的核心前提。我们提出了一种借助大语言模型(LLM)的半自动CFG构建方法。随后,我们归纳并生成涵盖五个主要指令类别(即方向变更、地标识别、区域识别、垂直运动和数值理解)的数据。对不同模型的分析揭示了显著的性能差异和持续性问题。数值理解的停滞、对方向概念的强选择性偏见,以及其他有趣的发现,为未来语言引导的导航系统的开发作出了贡献。

关键词

引用

@article{arxiv.2409.17313,
  title  = {Navigating the Nuances: A Fine-grained Evaluation of Vision-Language Navigation},
  author = {Zehao Wang and Minye Wu and Yixin Cao and Yubo Ma and Meiqi Chen and Tinne Tuytelaars},
  journal= {arXiv preprint arXiv:2409.17313},
  year   = {2024}
}

备注

EMNLP 2024 Findings; project page: https://zehao-wang.github.io/navnuances