基于跨任务注意力桥的雷达-相机BEV多任务学习用于联合3D检测与分割
计算机视觉与模式识别
2026-05-27 v2
摘要
鸟瞰图(BEV)表示是自动驾驶中3D感知的主导范式,它提供了一个统一的空间画布,使得检测和分割特征在几何上注册到同一物理坐标系。然而,现有的雷达-相机融合方法孤立地处理这些任务,错过了跨任务特征共享的机会:来自检测的物体级几何线索可以锐化分割,而来自分割的密集道路布局上下文可以为检测提供锚点。我们提出了CTAB(跨任务注意力桥),这是一个双向模块,通过共享BEV空间中的多尺度可变形注意力在检测和分割分支之间交换特征。CTAB被集成到一个多任务框架中,该框架包含一个基于实例归一化的分割解码器和可学习的BEV上采样,以提供更详细的BEV表示。在nuScenes上,CTAB在基本不影响检测性能的情况下,在联合多任务基线基础上提升了7个类别的分割效果。在一个4类子集(可行驶区域、人行横道、人行道、车辆)上,我们的联合多任务模型达到了51.0 mIoU-4,同时提供了具有竞争力的3D检测性能。
引用
@article{arxiv.2604.12918,
title = {Radar-Camera BEV Multi-Task Learning with Cross-Task Attention Bridge for Joint 3D Detection and Segmentation},
author = {Ahmet İnanç and Özgür Erkent},
journal= {arXiv preprint arXiv:2604.12918},
year = {2026}
}
备注
8 pages, 5 figures, 3 Tables, Accepted at Radar in Robotics: New Frontiers workshop, at IEEE International Conference on Robotics & Automation (ICRA), 2026