SA-Det3D:基于自注意力的上下文感知三维目标检测
计算机视觉与模式识别
2021-08-23 v5 人工智能
机器学习
摘要
现有的基于点云的三维目标检测器使用类卷积算子以固定权重核在局部邻域内处理信息,并分层聚合全局上下文。然而,用于二维视觉的非局部神经网络与自注意力已表明,显式建模长程交互可带来更鲁棒且更具竞争力的模型。本文中,我们提出两种用于三维目标检测中上下文建模的自注意力变体,通过将自注意力特征增强到卷积特征上。我们首先将成对自注意力机制融入当前最先进的基于BEV、体素与点的检测器中,并在KITTI验证集上相较强基线模型取得一致提升,3D AP最高提升1.5,同时将参数量与计算成本分别降低15–80%与30–50%。接着,我们提出一种自注意力变体,通过对随机采样位置学习形变来采样最具代表性特征的一个子集。这不仅使我们能够将显式全局上下文建模扩展到更大的点云,还带来了更具判别性与信息量的特征描述子。我们的方法可灵活应用于大多数最先进检测器,在提升精度的同时提高参数与计算效率。我们展示了所提方法在KITTI、nuScenes与Waymo Open数据集上改进了三维目标检测性能。代码见 https://github.com/AutoVision-cloud/SA-Det3D。
引用
@article{arxiv.2101.02672,
title = {SA-Det3D: Self-Attention Based Context-Aware 3D Object Detection},
author = {Prarthana Bhattacharyya and Chengjie Huang and Krzysztof Czarnecki},
journal= {arXiv preprint arXiv:2101.02672},
year = {2021}
}
备注
ICCV-2021 Av-Vision Workshop