中文

BEVPredFormer:用于自动驾驶鸟瞰图实例预测的时空注意力机制

计算机视觉与模式识别 2026-04-06 v1

摘要

对动态场景如何演变的鲁棒感知对于自动驾驶系统至关重要,因为它们必须准确检测、跟踪并预测周围障碍物的行为。依赖模块化架构的传统感知流程往往存在累积误差和延迟问题。实例预测模型提供了一种统一的解决方案,利用直接从不同传感器获取的信息,在当前帧和未来帧上执行鸟瞰图分割和运动估计。然而,这些模型的一个关键挑战在于如何有效处理动态驾驶环境中固有的密集时空信息。这种复杂程度要求架构能够在不牺牲实时性能的情况下捕捉细粒度的运动模式和长程依赖关系。我们提出了BEVPredFormer,这是一种用于鸟瞰图实例预测的新型纯视觉架构,它利用基于注意力的时间处理来增强对场景的时空理解,并依赖于基于注意力的相机信息3D投影。BEVPredFormer采用无循环设计,融合了门控Transformer层、分离的时空注意力机制和多尺度头任务。此外,我们还引入了一个差异引导的特征提取模块来增强时间表示。广泛的消融研究验证了每个架构组件的有效性。在nuScenes数据集上进行评估时,BEVPredFormer的性能与最先进的方法相当或更优,突显了其在实现鲁棒且高效的自动驾驶感知方面的潜力。

关键词

引用

@article{arxiv.2604.02930,
  title  = {BEVPredFormer: Spatio-temporal Attention for BEV Instance Prediction in Autonomous Driving},
  author = {Miguel Antunes-García and Santiago Montiel-Marín and Fabio Sánchez-García and Rodrigo Gutiérrez-Moreno and Rafael Barea and Luis M. Bergasa},
  journal= {arXiv preprint arXiv:2604.02930},
  year   = {2026}
}

备注

15 pages, 5 figures