中文

SPAN:用于单目3D目标检测的空间投影对齐

计算机视觉与模式识别 2026-03-11 v2

摘要

现有单目3D检测器通常通过解耦预测范式来控制3D边界框的显著非线性回归,采用多个分支分别估计几何中心、深度、尺寸和旋转角。虽然这种解耦策略简化了学习过程,但本质上忽略了不同属性之间几何协约约束,导致缺乏几何一致性先验,从而导致性能 suboptimal。为解决此问题,我们提出了具有两个关键组件的新型空间投影对齐(SPAN)方法:(i)。空间点对齐强制在预测边界框与真实边界框之间建立明确的全局空间约束,从而纠正因解耦属性回归导致的空间漂移。(ii)。3D-2D投影对齐确保投影后的3D边界框在图像平面上严格对齐于其对应的2D检测边界框,缓解了以往工作中忽视的投影错位。为确保训练稳定性,我们进一步引入分层任务学习策略,逐步将空间投影对齐纳入3D属性预测的优化过程中,防止早期阶段跨属性的误差传播。大量实验表明,所提方法可轻松集成到任何既定的单目3D检测器中,并显著提升性能。

关键词

引用

@article{arxiv.2511.06702,
  title  = {SPAN: Spatial-Projection Alignment for Monocular 3D Object Detection},
  author = {Yifan Wang and Yian Zhao and Fanqi Pu and Xiaochen Yang and Yang Tang and Xi Chen and Wenming Yang},
  journal= {arXiv preprint arXiv:2511.06702},
  year   = {2026}
}

备注

Accepted by CVPR 2026