SA-BEV:为多视角 3D 目标检测生成语义感知的鸟瞰图特征
计算机视觉与模式识别
2023-07-24 v1
摘要
近来,纯基于相机的鸟瞰图(BEV)感知为经济性自动驾驶提供了可行方案。然而,现有基于 BEV 的多视角 3D 检测器通常将所有图像特征变换为 BEV 特征,未考虑背景信息占比较大可能淹没目标信息的问题。本文中,我们提出语义感知 BEV 池化(SA-BEVPool),其可根据图像特征的语义分割滤除背景信息,并将图像特征变换为语义感知的 BEV 特征。相应地,我们提出 BEV-Paste,一种与语义感知 BEV 特征紧密匹配的有效数据增强策略。此外,我们设计了多尺度跨任务(MSCT)头,其结合任务特定与跨任务信息以更准确地预测深度分布与语义分割,进一步提升语义感知 BEV 特征的质量。最后,我们将上述模块集成入一种新颖的多视角 3D 目标检测框架,即 SA-BEV。在 nuScenes 上的实验表明 SA-BEV 取得了最先进的性能。代码已发布于 https://github.com/mengtan00/SA-BEV.git。
引用
@article{arxiv.2307.11477,
title = {SA-BEV: Generating Semantic-Aware Bird's-Eye-View Feature for Multi-view 3D Object Detection},
author = {Jinqing Zhang and Yanan Zhang and Qingjie Liu and Yunhong Wang},
journal= {arXiv preprint arXiv:2307.11477},
year = {2023}
}