中文

SGDrive:面向自动驾驶的场景到目标分层世界认知

计算机视觉与模式识别 2026-01-13 v2

摘要

最近的端到端自动驾驶方法利用视觉-语言模型(VLMs)来增强复杂驾驶场景中的规划能力。然而,VLMs 本质上是作为通用模型训练的,缺乏对3D空间和时间中驾驶特定推理的专业理解。当应用于自动驾驶时,这些模型难以建立结构化的时空表征,以捕捉对安全轨迹规划至关重要的几何关系、场景上下文和运动模式。为了解决这些局限性,我们提出了 SGDrive,这是一个新颖的框架,它明确地将 VLM 的表征学习围绕驾驶特定的知识层次进行结构化。SGDrive 构建在一个预训练的 VLM 骨干网络上,将驾驶理解分解为一个反映人类驾驶认知的场景-智能体-目标层次:驾驶员首先感知整体环境(场景上下文),然后关注与安全相关的智能体及其行为,最后在执行动作前制定短期目标。这种分层分解提供了通用 VLM 所缺乏的结构化时空表征,将多层次信息整合成一个紧凑而全面的格式用于轨迹规划。在 NAVSIM 基准上的大量实验表明,SGDrive 在 PDMS 和 EPDMS 上均达到了仅使用摄像头方法中的最先进性能,验证了分层知识结构化对于将通用 VLM 适配到自动驾驶的有效性。

关键词

引用

@article{arxiv.2601.05640,
  title  = {SGDrive: Scene-to-Goal Hierarchical World Cognition for Autonomous Driving},
  author = {Jingyu Li and Junjie Wu and Dongnan Hu and Xiangkai Huang and Bin Sun and Zhihui Hao and Xianpeng Lang and Xiatian Zhu and Li Zhang},
  journal= {arXiv preprint arXiv:2601.05640},
  year   = {2026}
}