PVAFN:基于多池化的点-体注意力融合网络用于 3D 目标检测
计算机视觉与模式识别
2024-08-28 v1
摘要
点和体表示的集成在 LiDAR 基于 3D 目标检测中变得越来越常见。然而,这种组合常常在有效捕获语义信息方面存在挑战。此外,仅依赖于兴趣区域内的点特征会导致信息丢失和局部特征表示的局限。为解决这些挑战,我们提出了一种新型两阶段 3D 目标检测器,称为 Point-Voxel Attention Fusion Network(PVAFN)。PVAFN 利用注意力机制在特征提取阶段改进多模态特征融合。在精炼阶段,它利用多池化策略有效地集成多尺度和区域特定信息。点-体注意力机制自适应地组合点云和基于体的 Bird's-Eye-View(BEV)特征,产生更丰富的对象表示,以帮助减少误检。此外,引入了多池化增强模块以提升模型的感知能力。该模块采用聚类池化和金字塔池化技术高效捕获关键几何细节和细粒度形状结构,从而增强局部和全局特征的集成。在 KITTI 和 Waymo 数据集上的大量实验表明,所提出的 PVAFN 达到了竞争性能。代码和模型将提供。
引用
@article{arxiv.2408.14600,
title = {PVAFN: Point-Voxel Attention Fusion Network with Multi-Pooling Enhancing for 3D Object Detection},
author = {Yidi Li and Jiahao Wen and Bin Ren and Wenhao Li and Zhenhuan Xu and Hao Guo and Hong Liu and Nicu Sebe},
journal= {arXiv preprint arXiv:2408.14600},
year = {2024}
}
备注
3D Object Detection