面向3D目标检测的轻量视角
计算机视觉与模式识别
2025-03-11 v1
摘要
理解环境并准确检测3D空间中的物体对于推进自动驾驶汽车技术至关重要。融合相机与 LIDAR 数据已成为在3D目标检测模型中实现高精度的有效方法。然而,现有方法通常依赖计算量大且沉重的传统骨干网络。本文引入一种新颖的方法,将前沿的深度学习技术融入特征提取过程,旨在在不牺牲性能的前提下构建更高效的模型。我们的模型 NextBEV 超越了 ResNet50 和 MobileNetV2 等成熟特征提取器。在 KITTI 3D单目检测基准上,NextBEV 实现了 2.39% 的精度提升,且其参数量不到 MobileNetV3 的 10%。此外,我们提出了对 LIDAR 骨干网络的改进,将原始推理时间降至 10 ms。同时,通过融合这些轻量化方案,我们将基于 VoxelNet 的模型的准确率提升了 2.93%,并将基于 PointPillar 的模型的 F1 分数提高了约 20%。因此,这项工作为单一或融合技术构建了轻量且强大的模型,使其更适合车载部署。
引用
@article{arxiv.2503.07133,
title = {A Light Perspective for 3D Object Detection},
author = {Marcelo Eduardo Pederiva and José Mario De Martino and Alessandro Zimmer},
journal= {arXiv preprint arXiv:2503.07133},
year = {2025}
}