中文

GraphPilot:基于场景图的语言驱动自动驾驶的 grounded 场景图条件化

计算机视觉与模式识别 2026-03-16 v3

摘要

视觉语言模型最近作为自动驾驶的有前景规划器而出现,其中成功取决于对多模态输入中空间结构和动态相互作用进行拓扑感知推理。然而,现有模型通常在没有显式编码这些关系依赖项的监督下进行训练,限制了其从原始传感器数据推断代理及其他交通实体如何相互影响的能力。本文通过一种新颖且模型无关的方法弥合了这一差距,该方法将结构化关系上下文(形式为交通场景图)条件化于语言驱动驾驶模型。我们在各种抽象层次和格式下序列化场景图,并通过结构化提示模板将其纳入模型,从而系统分析关系监督何时以及如何最有益且计算上最高效。在 LangAuto 和 Bench2Drive基准上的大规模评估显示,场景图条件化导致大规模且持久的改进。我们观察到与竞争性 LMDrive、BEVDriver 和 SimLingo 基线相比,我们提出的方法在驾驶得分方面实现了显著提升。这些结果表明,无需在测试时输入场景图,各种体系结构都能通过场景图条件化训练有效内化并 grounding 关系先验。代码、微调模型以及我们的场景图数据集均已公开 disponible at https://github.com/iis-esslingen/GraphPilot。

关键词

引用

@article{arxiv.2511.11266,
  title  = {GraphPilot: Grounded Scene Graph Conditioning for Language-Based Autonomous Driving},
  author = {Fabian Schmidt and Markus Enzweiler and Abhinav Valada},
  journal= {arXiv preprint arXiv:2511.11266},
  year   = {2026}
}