中文

单目三维目标检测的泛化

计算机视觉与模式识别 2025-08-28 v1

摘要

单目三维目标检测(Mono3D)是一项基础的计算机视觉任务,旨在从单张图像中估计目标的类别、三维位置、尺寸和朝向。其应用,包括自动驾驶、增强现实和机器人技术,关键性地依赖于准确的三维环境理解。本论文探讨了将 Mono3D 模型泛化到多样化场景的挑战,包括遮挡、数据集、目标尺寸和相机参数。为增强遮挡鲁棒性,我们提出了一种数学上可微的 NMS(GrooMeD-NMS)。为改善对新数据集的泛化,我们探索了深度等变(DEVIANT)骨干网络。我们解决大目标检测问题,证明其不仅是一个数据不平衡或感受野问题,还是一个噪声敏感性问题。为缓解此问题,我们在鸟瞰图中引入了一种基于分割的方法并结合 Dice 损失(SeaBird)。最后,我们从数学上分析了 Mono3D 模型向未见相机高度的外推,并在这些分布外设置中改善了 Mono3D 的泛化能力。

关键词

引用

@article{arxiv.2508.19593,
  title  = {Generalizing Monocular 3D Object Detection},
  author = {Abhinav Kumar},
  journal= {arXiv preprint arXiv:2508.19593},
  year   = {2025}
}

备注

PhD Thesis submitted to MSU