中文

DriveCombo:面向自动驾驶的组合式交通规则推理基准

计算机视觉与模式识别 2026-03-03 v1

摘要

多模态大语言模型 (MLLM) 正快速成为端到端自动驾驶系统的智能大脑。关键挑战在于评估 MLLM 是否能够真正理解并遵循复杂的现实交通规则。然而,现有基准主要关注单一规则场景,如交通标志识别,忽略了现实驾驶中多规则并发与冲突的复杂性。因此,模型在简单任务上表现良好,但在现实复杂情境下常常失败或违反规则。为弥合这一差距,我们提出了 DriveCombo,一个用于组合式交通规则推理的文本与视觉基准。灵感来自人类驾驶员的认知发展,我们提出了系统的五阶段认知梯队,用于评估从单规则理解到多规则整合与冲突解决的推理能力,实现跨认知阶段的定量评估。我们进一步提出了 Rule2Scene Agent,通过规则制作与场景生成,将语言化交通规则映射到动态驾驶场景,从而实现场景级交通规则视觉推理。对14个主流 MLLM 的评估显示,随任务复杂度增长性能下降,尤其在规则冲突时表现突出。在划分数据集并在训练集上微调后,我们进一步观察到在交通规则推理和下游规划能力方面均有显著提升。这些结果凸显了 DriveCombo 在推动符合规范且智能的自动驾驶系统方面的有效性。

关键词

引用

@article{arxiv.2603.01637,
  title  = {DriveCombo: Benchmarking Compositional Traffic Rule Reasoning in Autonomous Driving},
  author = {Enhui Ma and Jiahuan Zhang and Guantian Zheng and Tao Tang and Shengbo Eben Li and Yuhang Lu and Xia Zhou and Xueyang Zhang and Yifei Zhan and Kun Zhan and Zhihui Hao and Xianpeng Lang and Kaicheng Yu},
  journal= {arXiv preprint arXiv:2603.01637},
  year   = {2026}
}