中文

3D-MOOD:将 2D 提升至 3D 用于单目开放集目标检测

计算机视觉与模式识别 2025-09-08 v2

摘要

单目 3D 目标检测对机器人与 AR/VR 等各种应用具有重要价值。现有方法局限于闭集设置,即训练集与测试集由相同的场景和/或目标类别组成。然而,现实世界应用常引入新环境与新目标类别,对这些方法构成挑战。在本文中,我们探讨开放集设置下的单目 3D 目标检测,并引入首个端到端 3D 单目开放集目标检测器(3D-MOOD)。我们提议通过设计的 3D 边界框头将开放集 2D 检测提升至 3D 空间,实现 2D 与 3D 任务的端到端联合训练以获得更好的整体性能。我们以几何先验为条件处理对象查询,并克服了跨不同场景 3D 估计的泛化问题。为进一步提升性能,我们设计了规范图像空间以实现更高效的跨数据集训练。我们在闭集设置(Omni3D)与开放集设置(Omni3D 到 Argoverse 2、ScanNet)上对 3D-MOOD 进行了评估,并取得了新的 SOTA 结果。代码与模型可在 royyang0714.github.io/3D-MOOD 获取。

关键词

引用

@article{arxiv.2507.23567,
  title  = {3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection},
  author = {Yung-Hsu Yang and Luigi Piccinelli and Mattia Segu and Siyuan Li and Rui Huang and Yuqian Fu and Marc Pollefeys and Hermann Blum and Zuria Bauer},
  journal= {arXiv preprint arXiv:2507.23567},
  year   = {2025}
}

备注

ICCV 2025