SDVRF:面向多模态三维目标检测的稀疏到稠密体素区域融合
计算机视觉与模式识别
2023-09-19 v3 人工智能
摘要
在自动驾驶感知任务中,由于 LiDAR 点云与图像数据的互补特性,多模态方法已成为一种趋势。然而,多模态方法的性能通常受限于点云的稀疏性或由 LiDAR 与相机之间未对齐引起的噪声问题。为解决这两个问题,我们提出了一个新概念:体素区域(Voxel Region, VR),其通过动态投影每个体素中的稀疏局部点云获得。并提出了一种名为稀疏到稠密体素区域融合(Sparse-to-Dense Voxel Region Fusion, SDVRF)的新融合方法。具体而言,聚集 VR 内图像特征图中更多像素以补充从稀疏点提取的体素特征,实现更稠密的融合。同时,与先前投影固定尺寸网格的方法不同,我们生成动态区域的策略实现了更好的对齐,并避免了引入过多背景噪声。此外,我们提出了多尺度融合框架以提取更多上下文信息并捕获不同尺寸物体的特征。在 KITTI 数据集上的实验表明,我们的方法提升了不同基线的性能,尤其是在包括行人和骑行者在内的小尺寸类别上。
引用
@article{arxiv.2304.08304,
title = {SDVRF: Sparse-to-Dense Voxel Region Fusion for Multi-modal 3D Object Detection},
author = {Binglu Ren and Jianqin Yin},
journal= {arXiv preprint arXiv:2304.08304},
year = {2023}
}