DriveQA:通过驾驶知识测试
计算机视觉与模式识别
2025-09-01 v1
摘要
如果一型大型语言模型(LLM)今天参加驾驶知识考试,它能通过吗?除了当前自主驾驶基准测试中标准的空间和视觉问答(QA)任务之外,驾驶知识测试需要对所有交通规则、标志及让路原则进行完整理解。人类驾驶员必须辨别各种罕见出现于真实数据集中的边缘情况。在本工作中,我们提出了 DriveQA,一个广泛开源的文本和视觉基准测试,详尽覆盖交通规则和情景。通过我们的实验使用 DriveQA,我们显示 (1) 最先进的 LLM 和多模态 LLM(MLLM)在基本交通规则方面表现良好,但在数值推理和复杂让路情景、交通标志变体以及空间布局方面存在显著弱点;(2) 在 DriveQA 上的微调可提高多个类别的准确率,尤其是在监管标志识别和交叉口决策方面;(3) DriveQA-V 中的受控变体提供了关于模型对环境因素(如光照、视角、距离和天气条件)敏感性的见解;(4) 在 DriveQA 上的预训练可提高下游驾驶任务性能,导致在真实数据集如 nuScenes 和 BDD 上的结果得到改善,同时也表明模型能够内化文本和合成交通知识,以有效地在下游 QA 任务中泛化。
引用
@article{arxiv.2508.21824,
title = {DriveQA: Passing the Driving Knowledge Test},
author = {Maolin Wei and Wanzhou Liu and Eshed Ohn-Bar},
journal= {arXiv preprint arXiv:2508.21824},
year = {2025}
}
备注
Accepted by ICCV 2025. Project page: https://driveqaiccv.github.io/