中文

RoadBench:面向城市道路场景下 MLLM 粗粒度空间理解与推理的基准测试

计算机视觉与模式识别 2025-11-25 v1

摘要

多模态大语言模型(MLLMs)在一般空间理解和推理方面展现出强大的能力。然而,两大学科领域和行业都未充分关注其在复杂城市场景下粗粒度空间理解和推理能力。为填补这一空白,我们聚焦于道路标线,这是城市场景下典型的粗粒度空间元素的例子,因其在城市集成的交通网络中发挥着关键作用。围绕道路标线和城市交通系统,我们提出了RoadBench,一个系统化的基准测试,全面评估 MLLMs 在 BEV 和 FPV 图像输入下的粗粒度空间理解和推理能力。该基准测试包含六个任务,共9121个严格手动验证的测试案例。这些任务构建了一个系统化的评估框架,将理解从局部空间范围扩展到全局推理。它们不仅测试 MLLMs 在识别、联合理解和推理方面的能力,还评估其将图像信息与领域知识集成的能力。在评估14个主流 MLLMs后,我们确认RoadBench 是 MLLMs 具有挑战性的基准,揭示了现有 MLLMs 在城市场景下粗粒度空间理解和推理能力存在显著不足。在某些任务中,其性能甚至不足以匹配简单基于规则或随机选择的基线。这些发现以及 RoadBench 本身,将推动 MLLMs 空间理解能力的全面发展。基准代码、示例数据集和原始评估结果均已包含在补充材料中。

关键词

引用

@article{arxiv.2511.18011,
  title  = {RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios},
  author = {Jun Zhang and Jie Feng and Long Chen and Junhui Wang and Zhicheng Liu and Depeng Jin and Yong Li},
  journal= {arXiv preprint arXiv:2511.18011},
  year   = {2025}
}

备注

The code and data are publicly available at: https://github.com/tsinghua-fib-lab/RoadBench