中文

视觉语言模型是否已准备好应对自动驾驶中的车道拓扑感知?

计算机视觉与模式识别 2026-03-04 v3

摘要

视觉语言模型(VLM)近期在多模态推理方面取得了显著进展,然而它们在自动驾驶中的应用仍然有限。特别是,理解道路拓扑的能力——安全导航的一项关键要求——受到的关注相对较少。虽然最近的一些工作已开始探索VLM在驾驶场景中的应用,但它们在拓扑推理上的表现远不能令人满意。在这项工作中,我们系统地评估了VLM在道路拓扑理解方面的能力。具体而言,我们将多视图图像投影到统一的地平面坐标系中,并融合成鸟瞰图(BEV)车道。基于这些BEV车道,我们构建了四个与拓扑相关的诊断性视觉问答(VQA)任务,这些任务共同涵盖了空间拓扑推理的基本组成部分。通过广泛的评估,我们发现,尽管前沿的闭源模型(如GPT-4o)在某些任务上达到了相对较高的准确率,但它们在一些人类能够回答的空间问题上仍然失败(例如,GPT-4o在向量这一二分类问题上仅达到67.8%的准确率)。此外,我们发现开源VLM,即使是300亿参数规模的,也表现挣扎。这些结果表明,空间推理仍然是当前VLM的一个根本性瓶颈。我们还发现,模型的能力与模型大小、推理令牌长度以及提供的示例样本数呈正相关,这为未来的研究指明了方向。

关键词

引用

@article{arxiv.2509.16654,
  title  = {Are VLMs Ready for Lane Topology Awareness in Autonomous Driving?},
  author = {Xin Chen and Jia He and Maozheng Li and Dongliang Xu and Tianyu Wang and Yixiao Chen and Zhixin Lin and Yue Yao},
  journal= {arXiv preprint arXiv:2509.16654},
  year   = {2026}
}

备注

5 pages, 5 figures