CoBEV:利用深度与高度互补性提升路侧三维目标检测
计算机视觉与模式识别
2024-09-17 v3 机器人学
图像与视频处理
摘要
路侧相机驱动的三维目标检测是智能交通系统中的关键任务,其将感知范围扩展到以视觉为中心的车辆局限之外并提升道路安全。尽管先前研究仅使用深度或高度信息存在局限,我们发现深度与高度均至关重要且事实上互补。深度特征包含精确的几何线索,而高度特征主要关注区分不同类别的高度区间,本质上提供语义上下文。该洞见催生了 Complementary-BEV (CoBEV),一种新颖的端到端单目三维目标检测框架,其整合深度与高度以构建鲁棒的 BEV 表示。具体而言,CoBEV 估计每个像素的深度与高度分布,并利用新提出的两阶段互补特征选择(CFS)模块将相机特征提升至三维空间进行横向融合。BEV 特征蒸馏框架也被无缝集成,以从融合模态 CoBEV 教师的先验知识中进一步提升检测精度。我们在基于路侧相机的公开三维检测基准 DAIR-V2X-I 与 Rope3D,以及私有 Supremind-Road 数据集上进行了大量实验,表明 CoBEV 不仅达到了新的 SOTA 精度,还显著提升了先前方法在具有挑战性的远距离场景与噪声相机干扰下的鲁棒性,并在场景与相机参数剧烈变化的异源设置中大幅增强泛化能力。在 DAIR-V2X-I 上,相机模型的车辆 AP 分数首次在简单模式下达到 80%。源代码将公开于 https://github.com/MasterHow/CoBEV。
引用
@article{arxiv.2310.02815,
title = {CoBEV: Elevating Roadside 3D Object Detection with Depth and Height Complementarity},
author = {Hao Shi and Chengshan Pang and Jiaming Zhang and Kailun Yang and Yuhao Wu and Huajian Ni and Yining Lin and Rainer Stiefelhagen and Kaiwei Wang},
journal= {arXiv preprint arXiv:2310.02815},
year = {2024}
}
备注
Accepted to IEEE Transactions on Image Processing (TIP). The source code will be made publicly available at https://github.com/MasterHow/CoBEV