中文

基于可变形注意力的 BEV 图像轨迹预测——CASPFormer

机器学习 2025-04-15 v1 计算机视觉与模式识别

摘要

运动预测是自动驾驶(AD)和高级驾驶辅助系统(ADAS)的重要环节。当前最先进的运动预测方法依赖高清(HD)地图来获取以主车为中心的周围环境信息。此类系统在实际部署中缺乏可扩展性,因为 HD 地图的制作和实时更新成本高昂。为克服此问题,我们提出了基于情境感知的场景预测转换器(CASPFormer),可从raster化鸟瞰图(BEV)图像进行多模态运动预测。我们的系统可集成到能够生成 BEV 图像的任意上游感知模块中。此外,CASPFormer 能直接解码向量化轨迹,无需后处理。轨迹通过可变形注意力进行递归解码,因为其计算效率高,且使网络能够聚焦于 BEV 图像中重要的空间位置。此外,我们还通过引入可学习的模式查询来解决生成多个场景一致轨迹的模式坍缩问题。我们在 nuScenes 数据集上评估了模型,在多个指标上实现了最先进水平。

关键词

引用

@article{arxiv.2409.17790,
  title  = {CASPFormer: Trajectory Prediction from BEV Images with Deformable Attention},
  author = {Harsh Yadav and Maximilian Schaefer and Kun Zhao and Tobias Meisen},
  journal= {arXiv preprint arXiv:2409.17790},
  year   = {2025}
}

备注

Under Review at ICPR 2024, Kolkata