Real3D:利用真实世界图像扩展大型重建模型
计算机视觉与模式识别
2024-06-13 v1
摘要
训练单视图大型重建模型(LRM)的默认策略是使用大规模合成3D资产或多视角捕捉数据集进行全监督训练。尽管这些资源简化了训练过程,但它们难以扩展到现有数据集之外,并且不一定代表物体形状的真实分布。为了解决这些局限性,在本文中,我们介绍了Real3D,这是第一个可以使用单视图真实世界图像进行训练的LRM系统。Real3D引入了一种新颖的自训练框架,该框架可以同时受益于现有的合成数据和多样化的单视图真实图像。我们提出了两种无监督损失,使我们能够在像素级和语义级监督LRM,即使对于没有真实3D或新视角的训练示例也是如此。为了进一步提升性能并扩展图像数据,我们开发了一种自动数据整理方法,从野外图像中收集高质量示例。我们的实验表明,Real3D在四个不同的评估设置中始终优于先前的工作,这些设置包括真实和合成数据,以及域内和域外形状。代码和模型可在此处找到:https://hwjiang1510.github.io/Real3D/。
引用
@article{arxiv.2406.08479,
title = {Real3D: Scaling Up Large Reconstruction Models with Real-World Images},
author = {Hanwen Jiang and Qixing Huang and Georgios Pavlakos},
journal= {arXiv preprint arXiv:2406.08479},
year = {2024}
}
备注
Project page: https://hwjiang1510.github.io/Real3D/