中文

MonoPRIO:用于统一单目 3D 目标检测的自适应先验条件化

计算机视觉与模式识别 2026-05-15 v1

摘要

单目 3D 目标检测仍然具有挑战性,因为度量尺寸和深度无法由单视图证据完全确定,特别是在遮挡、截断和投影引起的尺度-深度模糊的情况下。尽管最近的方法改进了深度和几何推理,但在统一的多类设置中,度量尺寸仍然不稳定,其中类别可变性和部分可见性扩大了合理的尺寸模式。我们提出了 MonoPRIO,一种统一的单目 3D 检测器,通过在尺寸路径中进行自适应先验条件化来针对这一瓶颈。MonoPRIO 离线构建类感知尺寸原型,将每个解码器查询路由到软混合先验,应用不确定性感知的对数空间条件化,并在训练期间对匹配的正样本使用簇对齐先验 (CAP) 正则化。在官方 KITTI 测试服务器上,MonoPRIO 在报告完整 Car、Pedestrian 和 Cyclist 指标的方法中,取得了最强的完全报告的统一多类结果。在仅汽车设置中,它在相比方法中无需额外数据的情况下,在 Easy/Moderate/Hard 类别中取得了最强的 3D 边界框 AP,同时计算量显著低于 MonoCLUE。消融和诊断表明,路由注入和 CAP 带来了互补的增益,在易模糊、部分遮挡和低数据情况下的收益最大。这些发现表明,当图像证据无法确定度量尺寸时,自适应先验最为有效,而非典型几何或极端可见性丧失仍可能导致路由先验与真实实例几何之间的不匹配。代码、训练模型、结果日志和可复现材料可在 https://github.com/bigggs/MonoPRIO 获取。

关键词

引用

@article{arxiv.2605.14781,
  title  = {MonoPRIO: Adaptive Prior Conditioning for Unified Monocular 3D Object Detection},
  author = {Leon Davies and Qinggang Meng and Mohamad Saada and Baihua Li and Simon Sølvsten},
  journal= {arXiv preprint arXiv:2605.14781},
  year   = {2026}
}

备注

12 pages, 4 figures, 8 tables. Submitted to Pattern Recognition. Code and reproducibility material available at https://github.com/bigggs/MonoPRIO