中文

3DMiner:从大规模无标注图像数据集中发掘三维形状

计算机视觉与模式识别 2023-10-31 v1

摘要

我们提出 3DMiner——一种从具有挑战性的大规模无标注图像数据集中挖掘三维形状的流程。与其他无监督三维重建方法不同,我们假设在足够大的数据集中,必然存在形状相似但背景、纹理和视角各异的物体图像。我们的方法利用近期自监督图像表示学习的进展,将具有几何相似形状的图像聚类,并找出它们之间的公共图像对应点。随后,我们利用这些对应点获得粗略的相机估计,作为束调整(bundle-adjustment)的初始化。最后,对于每个图像簇,我们应用一种渐进式束调整重建方法,学习表征底层形状的神经占据场(neural occupancy field)。我们表明该流程对前序步骤引入的多类错误(例如错误的相机位姿、包含不相似形状的图像等)具有鲁棒性,从而使我们能够获得野外(in-the-wild)图像的形状与位姿标注。在使用 Pix3D 椅子图像时,我们的方法在定量与定性上均显著优于最先进的无监督三维重建技术。此外,我们展示了 3DMiner 如何通过重建 LAION-5B 数据集图像中存在的形状来应用于野外数据。项目主页:https://ttchengab.github.io/3dminerOfficial

关键词

引用

@article{arxiv.2310.19188,
  title  = {3DMiner: Discovering Shapes from Large-Scale Unannotated Image Datasets},
  author = {Ta-Ying Cheng and Matheus Gadelha and Soren Pirk and Thibault Groueix and Radomir Mech and Andrew Markham and Niki Trigoni},
  journal= {arXiv preprint arXiv:2310.19188},
  year   = {2023}
}

备注

In ICCV 2023