桥接结构与语言:面向自主道路理解的图基视觉推理
计算机视觉与模式识别
2026-05-21 v1
摘要
对车道几何、拓扑结构及交通要素关系的结构化道路理解是安全自主驾驶的基础。虽然视觉语言模型(VLM)提供了具有语义灵活性的前景,但缺乏实现精确道路推理所需的几何和关系 grounding。相反,传统模块化系统如高清地图和拓扑道路图提供结构精度,但保持语义刚性。为填补这一鸿沟,我们引入了 Combined Road Substrate(CRS),一种基于图的框架,使几何道路结构和开放词汇语义在单一表示中联合可执行。CRS 启用通过递归图查询自动生成组合复杂且语言多样的问答对,增强了“免费 grounding”机制,确保逻辑可追溯性到特定地图元素,并从中 procedurally 提取链式思维监督轨迹。我们展示,最先进的 VLM——包括大型闭源模型——在结构化道路推理方面表现显著受限,但使用仅 20 至 80 个 CRS 丰富场景训练的小型 2 或 4 亿参数模型即可在各种深度的组合推理任务中实现稳定提升。通过可验证的推理轨迹分析模型行为,揭示了 failure 模式的系统性转变:而基线模型在关系场景理解中失败,CRS 训练模型将失败归因于属性识别降低,表明道路理解的主要瓶颈并非模型规模,而是缺乏结构化监督。
引用
@article{arxiv.2605.20942,
title = {Bridging Structure and Language: Graph-Based Visual Reasoning for Autonomous Road Understanding},
author = {Lena Wild and Katie Z Luo and Marco Pavone},
journal= {arXiv preprint arXiv:2605.20942},
year = {2026}
}