基于 Perceiver 的三维边界框去噪单目三维目标检测
计算机视觉与模式识别
2023-04-05 v1
摘要
单目三维目标检测的主要挑战是三维中心的准确定位。受一种新颖且有力的观察——该挑战在理想情况下可通过三维空间局部网格搜索方案补救——的启发,我们提出了一种分阶段方法,以自顶向下的方式结合从 2D 到 3D(利用单张 2D 图像生成三维边界框提议)和从 3D 到 2D(利用 3D 到 2D 上下文去噪进行提议验证)的信息流。具体而言,我们首先从现成的骨干单目三维检测器获得初始提议。然后,通过对初始提议进行局部网格采样生成三维锚点空间。最后,我们在 3D 到 2D 提议验证阶段执行三维边界框去噪。为有效学习用于去噪高度重叠提议的判别性特征,本文提出一种使用 Perceiver I/O 模型融合 3D 到 2D 几何信息与 2D 外观信息的方法。利用提议的编码潜在表示,验证头由自注意力模块实现。我们的方法名为 MonoXiver,具有通用性,可轻松适配任何骨干单目三维检测器。在成熟的 KITTI 数据集和具挑战性的大规模 Waymo 数据集上的实验结果表明,MonoXiver 以有限的计算开销持续取得提升。
引用
@article{arxiv.2304.01289,
title = {Monocular 3D Object Detection with Bounding Box Denoising in 3D by Perceiver},
author = {Xianpeng Liu and Ce Zheng and Kelvin Cheng and Nan Xue and Guo-Jun Qi and Tianfu Wu},
journal= {arXiv preprint arXiv:2304.01289},
year = {2023}
}