中文

AutoDrive-QA:面向城市自动驾驶视觉语言评估的多选基准

计算机视觉与模式识别 2025-10-07 v2 机器人学

摘要

在城市驾驶情境中评估视觉语言模型 (Vision-Language Model, VLM) 仍存在挑战,因为现有基准依赖开放式回答,导致其模糊、标注成本高且评分不一致。缺乏标准化评估方法阻碍了向安全可靠的城市智能出行系统迈进。我们引入 AutoDrive-QA,这是首个系统性地将开放式驾驶问答数据集 (DriveLM、NuScenes-QA、LingoQA) 转换为结构化多选题 (Multiple-Choice Question, MCQ) 的基准测试,题干选项基于五类真实错误类型:驾驶领域误概念、逻辑不一致、误解传感器输入、计算疏忽以及问题模糊。该框架实现了 VLM 在复杂城市场景中感知、预测和规划任务的可复现、可解释评估。实验表明,微调 LLaVA-1.5-7B 可在各任务上提升约六个百分点准确率,GPT-4V 在零样本设置下取得最强表现,最高达 69.8% 的准确率,Qwen2-VL 模型在多视角场景中也表现出竞争力。此外,传统指标如 BLEU 和 CIDEr 无法有效区分强弱模型。通过提供客观、领域导向的评估协议,AutoDrive-QA 为城市 AI 系统的透明化基准测试贡献了技术,推动了更安全可信的自动驾驶技术发展,以服务智慧城市建设。

关键词

引用

@article{arxiv.2503.15778,
  title  = {AutoDrive-QA: A Multiple-Choice Benchmark for Vision-Language Evaluation in Urban Autonomous Driving},
  author = {Boshra Khalili and Andrew W. Smyth},
  journal= {arXiv preprint arXiv:2503.15778},
  year   = {2025}
}

备注

Updated results with larger dataset experiments and expanded discussion