VISTA:通过双跨视图空间注意力提升三维目标检测
计算机视觉与模式识别
2022-03-21 v1
摘要
从 LiDAR 点云中检测物体对自动驾驶具有极其重要的意义。尽管取得了良好进展,由于 LiDAR 点云的稀疏性与不规则性,准确可靠的三维检测尚待实现。在现有策略中,多视图方法通过利用来自鸟瞰图(BEV)与距离视图(RV)的更全面信息展现出巨大潜力。这些多视图方法要么通过融合特征细化从单视图预测的候选框,要么在未考虑全局空间上下文的情况下融合特征;因此其性能受限。本文中,我们提出通过双跨视图空间注意力(Dual Cross-VIew SpaTial Attention, VISTA)在全局空间上下文中自适应融合多视图特征。所提 VISTA 是一种新颖的即插即用融合模块,其中标准注意力模块中广泛采用的多层感知机被卷积层替代。得益于所学注意力机制,VISTA 能为候选框预测生成高质量的融合特征。我们在 VISTA 中解耦分类与回归任务,并施加额外的注意力方差约束,使注意力模块聚焦于特定目标而非通用点。我们在 nuScenes 与 Waymo 基准上进行了充分实验;结果证实了我们的设计有效性。在提交时,我们的方法在 nuScenes 基准上取得 63.0% 的总体 mAP 与 69.8% 的 NDS,在骑行者等安全关键类别上以高达 24% 的优势超越所有已发表方法。PyTorch 源代码可见于 https://github.com/Gorilla-Lab-SCUT/VISTA
引用
@article{arxiv.2203.09704,
title = {VISTA: Boosting 3D Object Detection via Dual Cross-VIew SpaTial Attention},
author = {Shengheng Deng and Zhihao Liang and Lin Sun and Kui Jia},
journal= {arXiv preprint arXiv:2203.09704},
year = {2022}
}
备注
Accepted by CVPR2022