面向自动驾驶鸟瞰图空间高效三维目标检测:一种纯卷积方法
计算机视觉与模式识别
2024-10-10 v2 人工智能
摘要
鸟瞰图(BEV)空间中的三维目标检测近年来已成为自动驾驶领域的主流方法。尽管与透视视图方法相比,在精度与速度估计方面已有提升,但 BEV 基技术在真实自动驾驶车辆上的部署仍具挑战。这主要源于其对视觉Transformer(ViT)基架构的依赖,后者相对于输入分辨率引入了二次复杂度。为解决此问题,我们提出了一种高效的 BEV 基三维检测框架 BEVENet,其利用纯卷积架构设计规避 ViT 模型的局限,同时保持 BEV 基方法的有效性。我们的实验表明,在 NuScenes 挑战赛上 BEVENet 比当代最先进(SOTA)方法快 3 倍,在 NuScenes 验证集上取得平均精度均值(mAP)0.456 与 nuScenes 检测分数(NDS)0.555,推理速度为 47.6 帧每秒。据我们所知,本研究首次实现 BEV 基方法如此显著的效率提升,凸显了其在真实自动驾驶应用中的更高可行性。
引用
@article{arxiv.2312.00633,
title = {Towards Efficient 3D Object Detection in Bird's-Eye-View Space for Autonomous Driving: A Convolutional-Only Approach},
author = {Yuxin Li and Qiang Han and Mengying Yu and Yuxin Jiang and Chaikiat Yeo and Yiheng Li and Zihang Huang and Nini Liu and Hsuanhan Chen and Xiaojun Wu},
journal= {arXiv preprint arXiv:2312.00633},
year = {2024}
}