AD²-Bench:面向不利条件下自动驾驶MLLM的分层思维链基准测试
计算机视觉与模式识别
2025-06-12 v1 人工智能
摘要
思维链(CoT)推理已成为增强多模态大模型(MLLM)结构化多步决策能力的强大方法,在自动驾驶中应对恶劣天气条件和复杂交通环境时尤为关键。然而,现有基准测试在评估这些特定且具有挑战性场景中的 CoT 过程方面存在明显不足。为弥补这一关键空白,我们提出了 AD²-Bench——首个专门面向不利天气和复杂场景下自动驾驶的思维链基准测试。AD²-Bench 精心构建以满足三个关键标准:覆盖多样化不利环境的全面数据覆盖、支持多步推理的细粒度标注,以及专门用于评估 CoT 性能的专用评估框架。AD²-Bench 的核心贡献在于其包含超过 5,400 个高质量人工标注 CoT 实例的广泛集合。这些标注中的每个中间推理步骤均被视为具有明确真值的原子单元,使得对 MLLM 在文本级、点级和区域级视觉提示下的推理过程能够进行前所未有的细粒度分析。我们对最先进 MLLM 在 AD²-Bench 上的全面评估显示准确率低于 60%,凸显了该基准测试的难度以及推进鲁棒、可解释端到端自动驾驶系统的必要性。因此,AD²-Bench 提供了一个标准化的评估平台,通过提升 MLLM 在自动驾驶中的推理能力推动研究进展,使其成为一项宝贵的资源。
引用
@article{arxiv.2506.09557,
title = {AD^2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions},
author = {Zhaoyang Wei and Chenhui Qiang and Bowen Jiang and Xumeng Han and Xuehui Yu and Zhenjun Han},
journal= {arXiv preprint arXiv:2506.09557},
year = {2025}
}