DriveMamba:高效端到端自动驾驶的任务导向可扩展状态空间模型
计算机视觉与模式识别
2026-02-25 v2
摘要
近期关于端到端自动驾驶(E2E-AD)的进展往往致力于将模块化设计集成到统一框架中进行联合优化,例如 UniAD,这些方法基于可分离的 Transformer 解码器遵循顺序范式(即感知-预测-规划),并依赖稠密 BEV 特征来编码场景表示。然而,这种人工排序设计不可避免地会导致信息损失和累积误差,缺乏对不同模块和传感器之间灵活且多样的关系建模。此外,图像 backbone 的训练不足以及注意力机制的二次复杂度也阻碍了 E2E-AD 系统处理时空输入的可扩展性和效率。为此,我们提出 DriveMamba,这是一个高效的 E2E-AD 任务导向可扩展范式,将动态任务关系建模、隐式视角对应学习和长期时序融合集成到单个一级 Unified Mamba 解码器中。具体而言,提取的图像特征和预期任务输出提前转换为基于标记的稀疏表示,并按其在 3D 空间中的实例位置进行排序。线性复杂度算子使对长时序稀疏标记建模能够高效捕获任务相关的相互依赖关系。此外,设计了一种双向轨迹引导的“从局部到全局”扫描方法,以保持来自自车视角的空间局部性,从而促进自车规划。在 nuScenes 和 Bench2Drive 数据集上进行的大量实验表明,DriveMamba 在性能、通用性和效率方面均显示出优势。
引用
@article{arxiv.2602.13301,
title = {DriveMamba: Task-Centric Scalable State Space Model for Efficient End-to-End Autonomous Driving},
author = {Haisheng Su and Wei Wu and Feixiang Song and Junjie Zhang and Zhenjie Yang and Junchi Yan},
journal= {arXiv preprint arXiv:2602.13301},
year = {2026}
}
备注
Accepted to ICLR2026