LoGoNet:面向精确三维目标检测的自局部到全局跨模态融合网络
计算机视觉与模式识别
2023-03-15 v2
摘要
激光雷达-相机融合方法在三维目标检测中已展现出令人印象深刻的性能。近期先进的多模态方法主要进行全局融合,即图像特征与点云特征在整个场景中进行融合。这种做法缺乏细粒度的区域级信息,导致融合性能次优。本文提出新颖的局部到全局融合网络(LoGoNet),在局部和全局两个层面执行激光雷达-相机融合。具体而言,LoGoNet 的全局融合(GoF)构建于已有文献之上,而我们独占地使用点质心来更精确地表示体素特征的位置,从而实现更好的跨模态对齐。至于局部融合(LoF),我们首先将每个候选框划分为均匀网格,然后将这些网格中心投影到图像上。采样投影网格点周围的图像特征,与位置修饰后的点云特征融合,最大限度地利用候选框周围丰富的上下文信息。进一步提出特征动态聚合(FDA)模块,以实现这些局部与全局融合特征之间的信息交互,从而产生信息更丰富的多模态特征。在 Waymo Open Dataset (WOD) 和 KITTI 数据集上的大量实验表明,LoGoNet 优于所有最先进的三维检测方法。值得注意的是,LoGoNet 在 Waymo 三维目标检测排行榜上排名第 1,并取得 81.02 mAPH (L2) 的检测性能。值得指出的是,三类目标的检测性能首次同时超过 80 APH (L2)。代码将发布于 \url{https://github.com/sankin97/LoGoNet}。
引用
@article{arxiv.2303.03595,
title = {LoGoNet: Towards Accurate 3D Object Detection with Local-to-Global Cross-Modal Fusion},
author = {Xin Li and Tao Ma and Yuenan Hou and Botian Shi and Yuchen Yang and Youquan Liu and Xingjiao Wu and Qin Chen and Yikang Li and Yu Qiao and Liang He},
journal= {arXiv preprint arXiv:2303.03595},
year = {2023}
}
备注
Accepted by CVPR2023