在自然场景中检测任意 3D 物体
计算机视觉与模式识别
2025-12-03 v3
摘要
尽管深度学习在闭集 3D 物体检测中取得了成功,但现有方法在泛化至新物体和相机配置的零样本场景中仍面临困难。我们引入了 DetAny3D,一种可提示的 3D 检测基础模型,能够仅利用单目输入在任意相机配置下检测任意新物体。训练用于 3D 检测的基础模型从根本上受到已标注 3D 数据有限可用性的制约,这促使 DetAny3D 利用广泛预训练的 2D 基础模型中嵌入的丰富先验知识来弥补这一稀缺性。为了有效地将 2D 知识转移到 3D,DetAny3D 包含两个核心模块:2D 聚合器(用于对齐来自不同 2D 基础模型的特征)和带有零嵌入映射的 3D 解释器(用于稳定 2D 到 3D 知识转移的早期训练)。实验结果验证了 DetAny3D 强大的泛化能力,它不仅在未见类别和新相机配置上实现了 SOTA 性能,而且在领域内数据上也超越了大多数竞争对手。DetAny3D 展示了 3D 基础模型在真实世界场景中多样化应用的潜力(例如自动驾驶中的罕见物体检测),并展示了对开放世界环境中以 3D 为中心的任务进行进一步探索的前景。更多可视化结果可在我们的代码库中找到。
引用
@article{arxiv.2504.07958,
title = {Detect Anything 3D in the Wild},
author = {Hanxue Zhang and Haoran Jiang and Qingsong Yao and Yanan Sun and Renrui Zhang and Hao Zhao and Hongyang Li and Hongzi Zhu and Zetong Yang},
journal= {arXiv preprint arXiv:2504.07958},
year = {2025}
}