中文

ImageNet3D:通用目标级 3D 理解

计算机视觉与模式识别 2024-06-17 v1

摘要

具备通用目标级 3D 理解能力的视觉模型应能够推断任意刚性对象在自然图像中的 2D 信息(如类别名称和边界框)以及 3D 信息(如 3D 位置和 3D 视角)。这一任务具有挑战性,因为它涉及从 2D 信号推断 3D 信息,更重要的是,要推广到来自未见类别的刚性对象。然而,现有带有对象级 3D 标注的数据集往往受限于类别数量或标注质量。基于这些数据集开发的模型对特定类别或领域的专家,难以实现通用性。在本工作中,我们提出 ImageNet3D,一个用于通用目标级 3D 理解的大型数据集。ImageNet3D 为 ImageNet 数据集中的 200 个类别补充 2D 边界框、3D 姿态、3D 位置标注,并交叉出现带有 3D 信息的图像说明。凭借 ImageNet3D 中的新标注,我们能够(i)分析视觉基础模型的对象级 3D 感知;(ii)研究和开发用于推断自然图像中任意刚性对象 2D 和 3D 信息的通用模型;(iii)将统一 3D 模型与大语言模型集成,用于 3D 相关推理。我们提出两种新任务:对象级 3D 感知探测和开放词汇姿态估计,除标准分类和姿态估计外。ImageNet3D 上的实验结果表明,该数据集在构建具备更强通用对象级 3D 理解能力的视觉模型方面具有潜力。

关键词

引用

@article{arxiv.2406.09613,
  title  = {ImageNet3D: Towards General-Purpose Object-Level 3D Understanding},
  author = {Wufei Ma and Guanning Zeng and Guofeng Zhang and Qihao Liu and Letian Zhang and Adam Kortylewski and Yaoyao Liu and Alan Yuille},
  journal= {arXiv preprint arXiv:2406.09613},
  year   = {2024}
}