中文

OPEN:用于多视角3D目标检测的对象级位置编码

计算机视觉与模式识别 2024-07-16 v1

摘要

准确的深度信息对于提高多视角3D目标检测性能至关重要。尽管一些现有的多视角检测器利用像素级深度监督取得了成功,但忽略了两个重要现象:1)来自LiDAR点的深度监督通常分布在物体表面,由于缺乏3D物体中心深度,这些深度不太适合现有的DETR-based3D检测器;2)对于远距离物体,整体物体的精细深度估计更具挑战性。因此,我们认为对象级深度(或3D目标中心)对于准确检测至关重要。本文提出一种新的多视角3D目标检测器,命名为OPEN,其核心思想是通过我们提出的对象级位置编码有效地将对象级深度信息注入网络。具体地,我们首先采用对象级深度编码器,该编码器以像素级深度图为先验,准确估计对象级深度。然后,我们利用提出的对象级位置编码将对象级深度信息编码到变换器解码器中,从而为最终检测生成3D感知特征。广泛的实验验证了我们所提出方法的有效性。此外,OPEN在nuScenes测试基准上实现了新的最先进性能,NDS为64.4%,mAP为56.7%。

关键词

引用

@article{arxiv.2407.10753,
  title  = {OPEN: Object-wise Position Embedding for Multi-view 3D Object Detection},
  author = {Jinghua Hou and Tong Wang and Xiaoqing Ye and Zhe Liu and Shi Gong and Xiao Tan and Errui Ding and Jingdong Wang and Xiang Bai},
  journal= {arXiv preprint arXiv:2407.10753},
  year   = {2024}
}

备注

Accepted by ECCV 2024