中文

SpaceDrive:将空间感知注入基于视觉语言模型的自动驾驶

计算机视觉与模式识别 2026-05-22 v2

摘要

建立在视觉语言模型(VLM)上的端到端自动驾驶方法正在因其通用视觉理解和从大规模预训练中获得的强大推理能力而快速发展。然而,我们发现当前的 VLM 难以理解细粒度的 3D 空间关系,这是与物理世界交互的系统的基本要求。为此,我们提出了 SpaceDrive,一种将空间信息作为显式位置编码(PE)而非文本数字 token 的空间感知 VLM-based driving 框架,使其能够对语义和空间表示进行联合推理。SpaceDrive 采用通用位置编码器处理来自多视角深度估计、历史自车状态和文本提示的所有 3D 坐标。这些 3D PE 首先叠加到相应的 2D 视觉 token 上进行增强。同时,它们作为任务中性坐标表示,取代数字逐位数值 token 作为 VLM 的输入和输出。这一机制使模型能够更好地在空间推理中索引特定视觉语义,并直接回归轨迹坐标,而不是逐位生成数字,从而增强了规划精度。广泛的实验表明,SpaceDrive 在 nuScenes 数据集上实现了基于 VLM 方法的最先进的开放式性能,并在 Bench2Drive 闭环基准测试中取得第二好的驾驶评分 78.02。代码可在 https://github.com/zhenghao2519/SpaceDrive 上获得。

关键词

引用

@article{arxiv.2512.10719,
  title  = {SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving},
  author = {Peizheng Li and Zhenghao Zhang and David Holtz and Hang Yu and Yutong Yang and Yuzhi Lai and Rui Song and Andreas Geiger and Andreas Zell},
  journal= {arXiv preprint arXiv:2512.10719},
  year   = {2026}
}