中文

MonoDGP:基于解耦查询与几何误差先验的单目 3D 目标检测

计算机视觉与模式识别 2025-03-13 v2

摘要

透视投影已广泛应用于单目 3D 目标检测方法中。它引入了来自 2D 边界框和 3D 目标尺寸的几何先验,以减少深度估计的不确定性。然而,由于源自目标视觉表面的深度误差,边界框的高度通常无法代表实际投影中心高度,这削弱了几何深度的有效性。对投影高度的直接预测不可避免地会导致 2D 先验的丢失,而具有复杂分支的多深度预测未能充分利用几何深度。本文提出了一种基于 Transformer 的单目 3D 目标检测方法,称为 MonoDGP,该方法采用透视不变几何误差来修改投影公式。我们还尝试系统地讨论和解释几何误差背后的机制和有效性,作为多深度预测的一种简单但有效的替代方案。此外,MonoDGP 解耦了深度引导解码器,并构建了一个仅依赖于视觉特征的 2D 解码器,在没有 3D 检测干扰的情况下提供 2D 先验并初始化目标查询。为了进一步优化和微调 Transformer 解码器的输入 token,我们还引入了区域分割头(RSH),用于生成增强特征和分割嵌入。我们的单目方法在 KITTI 基准上展现了 SOTA 性能,且无需额外数据。代码可在 https://github.com/PuFanqi23/MonoDGP 获取。

关键词

引用

@article{arxiv.2410.19590,
  title  = {MonoDGP: Monocular 3D Object Detection with Decoupled-Query and Geometry-Error Priors},
  author = {Fanqi Pu and Yifan Wang and Jiru Deng and Wenming Yang},
  journal= {arXiv preprint arXiv:2410.19590},
  year   = {2025}
}