SparseBEV:基于多摄像头视频的高性能稀疏三维目标检测
计算机视觉与模式识别
2023-09-06 v2
摘要
基于摄像头在 BEV(鸟瞰图)空间中的三维目标检测在过去几年中引起了极大关注。稠密检测器通常遵循两阶段流程,先构建稠密 BEV 特征,再在 BEV 空间执行目标检测,其缺陷在于复杂的视图变换与高计算成本。另一方面,稀疏检测器遵循基于查询的范式,无需显式构建稠密 BEV 特征,但性能劣于稠密对应方法。本文中,我们发现缓解此性能差距的关键在于检测器在 BEV 与图像空间中的适应性。为此,我们提出 SparseBEV,一种完全稀疏的三维目标检测器,其性能优于稠密对应方法。SparseBEV 包含三项关键设计:(1) 尺度自适应自注意力,用于在 BEV 空间中以自适应感受野聚合特征;(2) 自适应时空采样,在查询引导下生成采样位置;(3) 自适应混合,利用来自查询的动态权重解码采样特征。在 nuScenes 的 test 划分上,SparseBEV 取得 67.5 NDS 的 SOTA 性能。在 val 划分上,SparseBEV 取得 55.8 NDS,同时保持 23.5 FPS 的实时推理速度。代码见 https://github.com/MCG-NJU/SparseBEV。
引用
@article{arxiv.2308.09244,
title = {SparseBEV: High-Performance Sparse 3D Object Detection from Multi-Camera Videos},
author = {Haisong Liu and Yao Teng and Tao Lu and Haiguang Wang and Limin Wang},
journal= {arXiv preprint arXiv:2308.09244},
year = {2023}
}
备注
Accepted to ICCV 2023. This version fixes some typos