中文

自动驾驶极端情况下大型视觉语言模型的自动评估

计算机视觉与模式识别 2024-12-09 v5

摘要

大型视觉语言模型(LVLMs)因推动可解释自动驾驶而受到广泛关注。现有对LVLMs的评估主要关注自然场景下的多面能力,缺乏针对自动驾驶的自动化和可量化评估,更不用说严重的道路极端情况了。在这项工作中,我们提出了CODA-LM,这是第一个用于自动驾驶极端情况下LVLMs自动评估的基准。我们采用分层数据结构,并提示强大的LVLMs分析复杂驾驶场景,为人工标注者生成高质量预标注;而对于LVLM评估,我们表明使用纯文本大型语言模型(LLMs)作为评判者比LVLM评判者更能与人类偏好对齐。此外,利用我们的CODA-LM,我们构建了CODA-VLM,一个新的驾驶LVLM,在CODA-LM上超越了所有开源同类模型。我们的CODA-VLM与GPT-4V性能相当,在区域感知任务上甚至超过GPT-4V +21.42%。我们希望CODA-LM能成为促进由LVLMs驱动的可解释自动驾驶的催化剂。

关键词

引用

@article{arxiv.2404.10595,
  title  = {Automated Evaluation of Large Vision-Language Models on Self-driving Corner Cases},
  author = {Kai Chen and Yanze Li and Wenhua Zhang and Yanxin Liu and Pengxiang Li and Ruiyuan Gao and Lanqing Hong and Meng Tian and Xinhai Zhao and Zhenguo Li and Dit-Yan Yeung and Huchuan Lu and Xu Jia},
  journal= {arXiv preprint arXiv:2404.10595},
  year   = {2024}
}

备注

Accept by WACV 2025. Project Page: https://coda-dataset.github.io/coda-lm/