中文

MonoCLUE:对象感知聚类提升单目 3D 目标检测

计算机视觉与模式识别 2025-11-12 v1

摘要

单目 3D 目标检测为自动驾驶提供了成本效益高的解决方案,但受限于深度不确定和视场受限,导致几何线索不足,以及在遮挡或截断场景中精度下降。虽然近期方法加入额外深度信息以解决几何歧义,但忽视了对稳健识别至关重要的视觉线索。我们提出 MonoCLUE,通过利用局部聚类和广义场景记忆的视觉特征,增强单目 3D 检测。首先,对视觉特征进行 K 均值聚类,以捕获不同对象级别的外观部件(例如车灯、车顶),改善部分可见对象的检测。将聚类特征在区域之间传递以捕获具有相似外观的对象。其次,我们构建广义场景记忆,通过跨图像聚合聚类特征,提供可跨场景一致的表示。增强对象级别特征的一致性,使检测在不同环境中保持稳定。最后,我们将局部聚类特征和广义场景记忆整合到对象查询中,引导注意力聚焦于信息丰富的区域。通过统一的局部聚类和广义场景记忆策略,MonoCLUE 在遮挡和受限可见性条件下实现了稳健的单目 3D 检测,在 KITTI 数据集上实现了最先进的性能。

关键词

引用

@article{arxiv.2511.07862,
  title  = {MonoCLUE : Object-Aware Clustering Enhances Monocular 3D Object Detection},
  author = {Sunghun Yang and Minhyeok Lee and Jungho Lee and Sangyoun Lee},
  journal= {arXiv preprint arXiv:2511.07862},
  year   = {2025}
}

备注

Accepted to AAAI 2026