中文

Real3D:利用真实世界图像扩展大型重建模型

计算机视觉与模式识别 2024-06-13 v1

摘要

训练单视图大型重建模型(LRM)的默认策略是使用大规模合成3D资产或多视角捕捉数据集进行全监督训练。尽管这些资源简化了训练过程,但它们难以扩展到现有数据集之外,并且不一定代表物体形状的真实分布。为了解决这些局限性,在本文中,我们介绍了Real3D,这是第一个可以使用单视图真实世界图像进行训练的LRM系统。Real3D引入了一种新颖的自训练框架,该框架可以同时受益于现有的合成数据和多样化的单视图真实图像。我们提出了两种无监督损失,使我们能够在像素级和语义级监督LRM,即使对于没有真实3D或新视角的训练示例也是如此。为了进一步提升性能并扩展图像数据,我们开发了一种自动数据整理方法,从野外图像中收集高质量示例。我们的实验表明,Real3D在四个不同的评估设置中始终优于先前的工作,这些设置包括真实和合成数据,以及域内和域外形状。代码和模型可在此处找到:https://hwjiang1510.github.io/Real3D/。

关键词

引用

@article{arxiv.2406.08479,
  title  = {Real3D: Scaling Up Large Reconstruction Models with Real-World Images},
  author = {Hanwen Jiang and Qixing Huang and Georgios Pavlakos},
  journal= {arXiv preprint arXiv:2406.08479},
  year   = {2024}
}

备注

Project page: https://hwjiang1510.github.io/Real3D/