中文

视觉LLM是否准备就绪?面向安全关键驾驶视频理解的综合基准

计算机视觉与模式识别 2025-04-22 v1 计算与语言

摘要

视觉大语言模型(VLLM)在图像描述和视觉问答等通用视觉任务方面已展现出惊人的能力。然而,其在专门且安全关键的领域,如自动驾驶中,的有效性仍鲜有探索。自动驾驶系统需要在复杂环境中进行 sophisticated 场景理解,而现有的多模态基准主要聚焦于正常驾驶条件,无法充分评估VLLM在安全关键情境下的性能。为此,我们引入DVBench——一个旨在评估VLLM理解安全关键驾驶视频的先驱性基准。该基准基于层次化能力分类框架,与广泛采用用于描述高度自动驾驶系统中驾驶情境的框架相吻合,包含10,000个多选题,人工标注准确答案,实现对VLLM在感知和推理方面能力的全面评估。对14个SOTA VLLM(参数规模从0.5B至72B)进行实验,结果显示性能差距显著,暂无模型能超过40%的准确率,凸显了理解复杂驾驶情境的关键局限。为探索适应性,我们使用DVBench中的领域特定数据对选定模型进行微调,准确率提升5.24至10.94个百分点,相对提升最高达43.59%。这一改进凸显了针对通用VLLM与使命关键驾驶应用之间差距而进行针对性适应的必要性。DVBench为开发满足实际自主系统安全性和鲁棒性要求的VLLM建立了 essential 评估框架和研究路线图。我们已在https://github.com/tong-zeng/DVBench.git发布基准工具箱和微调模型。

关键词

引用

@article{arxiv.2504.14526,
  title  = {Are Vision LLMs Road-Ready? A Comprehensive Benchmark for Safety-Critical Driving Video Understanding},
  author = {Tong Zeng and Longfeng Wu and Liang Shi and Dawei Zhou and Feng Guo},
  journal= {arXiv preprint arXiv:2504.14526},
  year   = {2025}
}