LabelAny3D:野外任意 3D 目标检测
计算机视觉与模式识别
2026-01-06 v1
摘要
从单目输入检测 3D 空间中的物体对于从机器人到场景理解等应用至关重要。尽管在室内和自动驾驶领域取得了先进性能,但现有的单目 3D 检测模型在野外图像上难以胜任,由于缺乏野外 3D 数据集以及 3D 标注的挑战。我们引入 LabelAny3D,一个以分析-合成为方法的框架,从 2D 图像重建完整的 3D 场景,以高效产出高质量的 3D 边界框标注。基于此管道,我们提出 COCO3D,一个新的开放词汇单目 3D 检测基准数据集,源自 MS-COCO 数据集,覆盖了现有 3D 数据集中缺失的广泛目标类别。实验表明,LabelAny3D 生成的标注显著提升了单目 3D 检测性能,超越了现有自动标注方法在质量上的表现。这些结果表明,基于基础模型驱动的标注在现实开放世界环境中扩展 3D 识别具有前景。
引用
@article{arxiv.2601.01676,
title = {LabelAny3D: Label Any Object 3D in the Wild},
author = {Jin Yao and Radowan Mahmud Redoy and Sebastian Elbaum and Matthew B. Dwyer and Zezhou Cheng},
journal= {arXiv preprint arXiv:2601.01676},
year = {2026}
}
备注
NeurIPS 2025. Project page: https://uva-computer-vision-lab.github.io/LabelAny3D/