SparseVoxFormer:用于多模态3D目标检测的稀疏体素Transformer
计算机视觉与模式识别
2025-03-12 v1
摘要
以往大多数利用激光雷达和相机多模态特性的3D目标检测方法均采用鸟瞰图(BEV)空间作为中间特征表示。然而,该空间使用较低的x、y分辨率并牺牲z轴信息以降低整体特征分辨率,可能导致精度下降。为解决低分辨率特征的使用问题,本文聚焦于激光雷达点云数据的稀疏性。据我们观察,尽管体素分辨率显著更高,但由激光雷达数据构建的3D体素中已占据的单元数量甚至可能少于BEV地图中的总单元数。基于此,我们提出了一种用于3D目标检测的新型稀疏体素Transformer网络,命名为SparseVoxFormer。我们不执行BEV特征提取,而是直接利用稀疏体素特征作为基于Transformer的检测器的输入。此外,针对相机模态,我们引入了一种显式模态融合方法,该方法将3D体素坐标投影到2D图像上并收集相应的图像特征。得益于这些组件,我们的方法能够利用几何上更丰富的多模态特征,甚至降低了计算成本。在概念验证之外,我们进一步致力于促进更好的多模态融合并实现对稀疏特征数量的灵活控制。最后,详尽的实验结果表明,利用数量显著更少的稀疏特征大幅降低了3D目标检测器的计算成本,同时提升了整体和远距离性能。
引用
@article{arxiv.2503.08092,
title = {SparseVoxFormer: Sparse Voxel-based Transformer for Multi-modal 3D Object Detection},
author = {Hyeongseok Son and Jia He and Seung-In Park and Ying Min and Yunhao Zhang and ByungIn Yoo},
journal= {arXiv preprint arXiv:2503.08092},
year = {2025}
}