MaskBEV:面向 BEV 检测与地图分割的统一框架
计算机视觉与模式识别
2024-08-20 v1
摘要
准确且鲁棒的多模态多任务感知对现代自动驾驶系统至关重要。然而,当前的多模态感知研究遵循为特定感知任务设计的独立范式,导致任务间缺乏互补学习,并因联合训练而降低多任务学习 (MTL) 的性能。在本文中,我们提出 MaskBEV,一种基于掩码注意力的 MTL 范式,统一了 3D 目标检测与鸟瞰图 (BEV) 地图分割。MaskBEV 引入了一个任务无关的 Transformer 解码器来处理这些多样化任务,使得 MTL 能够在一个统一的解码器中完成,无需额外设计特定任务头。为充分利用 BEV 空间中 BEV 地图分割与 3D 目标检测任务间的互补信息,我们提出了空间调制和场景级上下文聚合策略。这些策略考虑了 BEV 分割与 3D 检测之间的内在依赖关系,自然提升了 MTL 性能。在 nuScenes 数据集上的大量实验表明,与先前最先进的 MTL 方法相比,MaskBEV 在 3D 目标检测中实现了 1.3 NDS 的提升,在 BEV 地图分割中实现了 2.7 mIoU 的提升,同时展现出略领先的推理速度。
引用
@article{arxiv.2408.09122,
title = {MaskBEV: Towards A Unified Framework for BEV Detection and Map Segmentation},
author = {Xiao Zhao and Xukun Zhang and Dingkang Yang and Mingyang Sun and Mingcheng Li and Shunli Wang and Lihua Zhang},
journal= {arXiv preprint arXiv:2408.09122},
year = {2024}
}
备注
Accepted to ACM MM 2024