Pyramid R-CNN:面向更优性能与适应性的三维目标检测
计算机视觉与模式识别
2021-09-07 v1
摘要
我们提出一个灵活且高性能的框架,名为 Pyramid R-CNN,用于从点云中进行两阶段三维目标检测。当前方法通常依赖于第二阶段的感兴趣点或体素进行 RoI 特征提取,但无法有效处理这些点的稀疏性与非均匀分布,并可能导致远处目标检测失败。为解决这些问题,我们提出一种新颖的第二阶段模块,名为金字塔 RoI 头,以自适应地从稀疏的感兴趣点中学习特征。金字塔 RoI 头由三个关键组件构成。首先,我们提出 RoI-grid 金字塔,其通过以金字塔方式广泛收集每个 RoI 的感兴趣点来缓解稀疏性问题。其次,我们提出 RoI-grid 注意力,一种将基于常规注意力与基于图的点算子整合进统一表述的新操作,可从稀疏点编码更丰富的信息。第三,我们提出密度感知半径预测 (DARP) 模块,其可通过动态调整 RoI 的聚焦范围来适应不同的点密度水平。结合这三个组件,我们的金字塔 RoI 头对稀疏与不平衡环境具有鲁棒性,并可应用于各类三维骨干网络以持续提升检测性能。大量实验表明,Pyramid R-CNN 在 KITTI 数据集与 Waymo Open 数据集上均以大幅优势优于最先进的 (SOTA) 三维检测模型。
引用
@article{arxiv.2109.02499,
title = {Pyramid R-CNN: Towards Better Performance and Adaptability for 3D Object Detection},
author = {Jiageng Mao and Minzhe Niu and Haoyue Bai and Xiaodan Liang and Hang Xu and Chunjing Xu},
journal= {arXiv preprint arXiv:2109.02499},
year = {2021}
}
备注
To appear at ICCV 2021