DenseBEV: 将BEV网格单元转化为3D目标
计算机视觉与模式识别
2025-12-19 v1
摘要
在当前研究中,基于鸟瞰图(BEV)的Transformer越来越多地被用于多相机3D目标检测。传统模型通常采用随机查询作为锚点,并依次对其进行优化。最近的进展通过辅助网络的检测结果来补充或替代这些随机查询。我们提出了一种更直观、更高效的方法,直接使用BEV特征单元作为锚点。这种端到端方法利用了BEV查询的密集网格,将每个单元视为最终检测任务的潜在目标。因此,我们提出了一种专门用于多相机3D目标检测的新型两阶段锚点生成方法。为了解决大量查询带来的注意力缩放问题,我们采用了基于BEV的非极大值抑制,使梯度仅通过未被抑制的目标流动。这确保了高效训练,无需后处理。通过直接使用来自BEVFormer等编码器的BEV特征作为目标查询,时序BEV信息被固有地嵌入。在对象查询中已嵌入的时序BEV信息基础上,我们通过整合先验检测结果,提出了一种混合时序建模方法,以进一步提升检测性能。在nuScenes数据集上评估我们的方法表明,即使BEV网格更稀疏、初始锚点更少,与基线相比,NDS和mAP仍有一致且显著的提升。该方法对小型目标尤为有效,在nuScenes上行人检测的mAP提升了3.8%,在Waymo上LET-mAP提升了8%。将我们命名为DenseBEV的方法应用于具有挑战性的Waymo Open数据集,取得了最先进的性能,LET-mAP达到60.7%,超越先前最佳结果5.4%。代码可在 https://github.com/mdaehl/DenseBEV 获取。
引用
@article{arxiv.2512.16818,
title = {DenseBEV: Transforming BEV Grid Cells into 3D Objects},
author = {Marius Dähling and Sebastian Krebs and J. Marius Zöllner},
journal= {arXiv preprint arXiv:2512.16818},
year = {2025}
}
备注
15 pages, 8 figures, accepted by WACV 2026