中文

WildDet3D: 野生场景下的可提示3D目标检测扩张

计算机视觉与模式识别 2026-04-21 v2

摘要

从单张图像中理解3D空间中的物体是空间智能的核心步骤之一。为实现此目标,单目3D目标检测——从输入RGB图像中恢复物体的尺度、位置和姿态——至关重要。为了在开放世界中实用,此类检测器必须能够超越封闭类别、支持多样化的提示模态,并在可用的几何线索可用时加以利用。当前方法进展受限于两个瓶颈:现有方法设计为单一提示类型,且缺乏机制来整合额外的几何线索;而当前3D数据集仅覆盖受控环境中的狭窄类别,限制了开放世界的迁移能力。为解决上述问题,本文首先引入WildDet3D,一个统一的几何感知架构,原生支持文本、点和框提示,并可在推理时集成辅助深度信号。其次,本文提出WildDet3D-Data,目前规模最大的开放3D检测数据集,通过从现有2D标注生成候选3D框并仅保留经人工验证的框,得到超过100万张图像,覆盖13.5K个类别,分布于多样化的真实场景中。WildDet3D在多个基准和设置下均达成新纪录。在开放世界设置下,野生场景下的WildDet3D-Bench上,以文本和框提示分别实现22.6/24.8 AP3D。在Omni3D上,以文本和框提示分别达到34.2/36.4 AP3D。在零样态评估中,野生场景下的Argoverse 2和ScanNet分别实现40.3/48.9 ODS。值得注意的是,在推理时加入深度线索可在各设置下平均提升+20.7 AP。

关键词

引用

@article{arxiv.2604.08626,
  title  = {WildDet3D: Scaling Promptable 3D Detection in the Wild},
  author = {Weikai Huang and Jieyu Zhang and Sijun Li and Taoyang Jia and Jiafei Duan and Yunqian Cheng and Jaemin Cho and Matthew Wallingford and Rustin Soraki and Chris Dongjoo Kim and Shuo Liu and Donovan Clay and Taira Anderson and Winson Han and Ali Farhadi and Bharath Hariharan and Zhongzheng Ren and Ranjay Krishna},
  journal= {arXiv preprint arXiv:2604.08626},
  year   = {2026}
}

备注

code: https://github.com/allenai/WildDet3D website: https://allenai.github.io/WildDet3D/