中文

GMF-Drive:面向端到端自动驾驶的带空间感知 BEV 表征的门控 Mamba 融合

计算机视觉与模式识别 2025-08-13 v2 机器人学

摘要

基于扩散的模型正在重新定义端到端自动驾驶的最新技术水平,但其性能日益受到对基于 Transformer 融合依赖的制约。这些架构面临根本性限制:二次计算复杂度限制了高分辨率特征的使用,而缺乏空间先验则阻碍了它们有效建模鸟瞰图(BEV)表征的固有结构。本文提出了 GMF-Drive(面向驾驶的门控 Mamba 融合),一个通过两项原则性创新克服这些挑战的端到端框架。首先,我们用一种几何增强的柱状格式取代了信息受限的基于直方图的 LiDAR 表征,该格式编码了形状描述符和统计特征,保留了关键的三维几何细节。其次,我们提出了一种新颖的分层门控 Mamba 融合(GM-Fusion)架构,用一个高效、具有空间感知能力的状态空间模型(SSM)替代了昂贵的 Transformer。其核心 BEV-SSM 利用方向性序列化和自适应融合机制,以线性复杂度捕获长距离依赖关系,同时明确尊重驾驶场景独特的空间属性。在具有挑战性的 NAVSIM 基准上的大量实验表明,GMF-Drive 达到了新的最先进性能,显著优于 DiffusionDrive。全面的消融研究验证了每个组件的有效性,证明在自动驾驶领域,特定任务的 SSM 在性能和效率上都能超越通用 Transformer。

关键词

引用

@article{arxiv.2508.06113,
  title  = {GMF-Drive: Gated Mamba Fusion with Spatial-Aware BEV Representation for End-to-End Autonomous Driving},
  author = {Jian Wang and Chaokang Jiang and Haitao Xu},
  journal= {arXiv preprint arXiv:2508.06113},
  year   = {2025}
}

备注

7 pages, 4 figures