中文

自动驾驶中大型视觉语言模型的细粒度评估

计算与语言 2025-03-28 v1 计算机视觉与模式识别

摘要

现有的自动驾驶视觉语言模型基准主要通过粗粒度任务中的开放式视觉问答来评估可解释性,这不足以评估复杂驾驶场景中的能力。为此,我们引入了 VLADBench\textbf{VLADBench},这是一个具有挑战性且细粒度的数据集,其特征是包含封闭式问答,从静态基础知识和元素逐步过渡到针对动态路况的高级推理。精心设计的 VLADBench\textbf{VLADBench} 涵盖 5 个关键领域:交通知识理解、一般元素识别、交通图生成、目标属性理解以及自车决策与规划。这些领域进一步细分为 11 个二级方面和 29 个三级任务,以实现细粒度评估。在该基准上对通用和特定领域视觉语言模型进行全面评估,揭示了它们在自动驾驶场景中的优势与关键局限性。为了进一步利用这 5 个领域之间的认知和推理交互来理解自动驾驶,我们从小规模视觉语言模型出发,并在各个领域数据集上训练特定领域模型(这些数据集来源于公开渠道的 140 万条特定领域问答)。实验结果表明,所提出的基准为全面评估自动驾驶中的视觉语言模型迈出了关键一步,为开发认知更复杂、推理能力更强的自动驾驶系统铺平了道路。

关键词

引用

@article{arxiv.2503.21505,
  title  = {Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving},
  author = {Yue Li and Meng Tian and Zhenyu Lin and Jiangtong Zhu and Dechang Zhu and Haiqiang Liu and Zining Wang and Yueyi Zhang and Zhiwei Xiong and Xinhai Zhao},
  journal= {arXiv preprint arXiv:2503.21505},
  year   = {2025}
}