导航细微差异:面向视觉语言导航的细粒度评估
计算机视觉与模式识别
2024-09-27 v1 人工智能
计算与语言
摘要
本研究提出了一种新的评估框架,用于视觉语言导航(VLN)任务。旨在对当前模型在各种指令类别方面的表现进行更细致的诊断。该框架基于任务的上下文无关语法(CFG)构建。CFG是问题分解和指令类别设计的核心前提。我们提出了一种借助大语言模型(LLM)的半自动CFG构建方法。随后,我们归纳并生成涵盖五个主要指令类别(即方向变更、地标识别、区域识别、垂直运动和数值理解)的数据。对不同模型的分析揭示了显著的性能差异和持续性问题。数值理解的停滞、对方向概念的强选择性偏见,以及其他有趣的发现,为未来语言引导的导航系统的开发作出了贡献。
引用
@article{arxiv.2409.17313,
title = {Navigating the Nuances: A Fine-grained Evaluation of Vision-Language Navigation},
author = {Zehao Wang and Minye Wu and Yixin Cao and Yubo Ma and Meiqi Chen and Tinne Tuytelaars},
journal= {arXiv preprint arXiv:2409.17313},
year = {2024}
}
备注
EMNLP 2024 Findings; project page: https://zehao-wang.github.io/navnuances