中文

Drive-P2D:面向自动驾驶中视觉语言模型的渐进式感知到决策基准

人工智能 2026-05-27 v2 计算机视觉与模式识别 机器人学

摘要

自动驾驶需要在复杂场景中实现可靠的感知与安全的决策。最近的视觉语言模型(VLM)展示了推理与泛化能力,为自动驾驶开辟了新可能性;然而,现有基准常将感知与决策评估分离,采用仅限选择的格式限制了故障分析,或通过LLM评分的长形式输出引入评估偏差。为此,我们提出Drive-P2D,一个覆盖Object、Scene与Decision三个层级的渐进式感知到决策基准,包含6650个问题。Drive-P2D采用分离的推理与答复协议:最终答案采用客观评分,而推理过程被分析以识别沿感知到决策链暴露的错误模式。我们评估了主流VLMs在所有及高风险场景中的表现,并通过相关性分析和同场景鲁棒性测试进一步刻画了感知到决策的能力边界。推理过程进一步揭示了逻辑推理错误和语义特征遗漏等故障模式,我们训练了一个轻量级分析器模型以自动化对推理的大规模错误模式标注。综合这些设计,为构建面向实际自动驾驶的更安全更可靠VLMs提供了实用见解。

关键词

引用

@article{arxiv.2601.14702,
  title  = {Drive-P2D: A Progressive Perception-to-Decision Benchmark for VLMs in Autonomous Driving},
  author = {Zecong Tang and Zixu Wang and Yifei Wang and Weitong Lian and Tianjian Gao and Haoran Li and Tengju Ru and Lingyi Meng and Zhejun Cui and Yichen Zhu and Qi Kang and Kaixuan Wang and Yu Zhang},
  journal= {arXiv preprint arXiv:2601.14702},
  year   = {2026}
}