PoIFusion:基于兴趣点融合的多模态三维目标检测
计算机视觉与模式识别
2024-09-24 v2
摘要
本文提出了PoIFusion,一个概念简洁但高效的多模态三维目标检测框架,通过在兴趣点(PoIs)处融合RGB图像和LiDAR点云信息。与当前最精确的方法不同——这些方法通常将多传感器数据转换到统一视图或利用全局注意力机制促进融合——我们的方法保持了每种模态的视图,并通过计算友好的投影和插值获取多模态特征。具体而言,PoIFusion遵循基于查询的目标检测范式,将目标查询表示为动态三维边界框,并基于每个查询框生成一组兴趣点。这些兴趣点作为表示三维目标的关键点,并充当多模态融合的基本单元。我们将兴趣点投影到每种模态的视图中以采样相应特征,并通过动态融合块在每个兴趣点处整合多模态特征。随后,源自同一查询框的兴趣点特征被聚合以更新查询特征。我们的方法避免了视图变换导致的信息损失,并消除了计算密集的全局注意力,使多模态三维目标检测器更具实用性。我们在nuScenes和Argoverse2数据集上进行了广泛实验以评估该方法。值得注意的是,所提出的方法在两个数据集上均达到了最先进的结果,无需任何额外技巧,即在nuScenes上达到74.9% NDS和73.4% mAP,在Argoverse2上达到31.6% CDS和40.6% mAP。代码将发布于\url{https://djiajunustc.github.io/projects/poifusion}。
引用
@article{arxiv.2403.09212,
title = {PoIFusion: Multi-Modal 3D Object Detection via Fusion at Points of Interest},
author = {Jiajun Deng and Sha Zhang and Feras Dayoub and Wanli Ouyang and Yanyong Zhang and Ian Reid},
journal= {arXiv preprint arXiv:2403.09212},
year = {2024}
}
备注
https://djiajunustc.github.io/projects/poifusion