MegaSynth:利用合成数据扩展三维场景重建
计算机视觉与模式识别
2025-02-25 v2
摘要
我们提出通过使用合成数据进行训练来扩展三维场景重建。我们工作的核心是 MegaSynth,这是一个程序化生成的三维数据集,包含 70 万个场景——比此前的真实数据集 DL3DV 大 50 倍以上——从而大幅扩展了训练数据。为了实现可扩展的数据生成,我们的核心思想是消除语义信息,去除对复杂语义先验(如物体可供性与场景构成)的建模需求。相反,我们使用基本空间结构和几何基元对场景进行建模,从而提供可扩展性。此外,我们控制数据复杂度以促进训练,同时使其与真实世界数据分布松散对齐,以利于真实世界的泛化。我们探索了使用 MegaSynth 和可用真实数据训练大型重建模型。实验结果表明,使用 MegaSynth 进行联合训练或预训练,可在多种图像域上将重建质量提升 1.2 至 1.8 dB PSNR。此外,仅在 MegaSynth 上训练的模型与在真实数据上训练的模型表现相当,这凸显了三维重建的低级特性。此外,我们还深入分析了 MegaSynth 在增强模型能力、训练稳定性和泛化方面的特性,以及在其他任务中的应用。
引用
@article{arxiv.2412.14166,
title = {MegaSynth: Scaling Up 3D Scene Reconstruction with Synthesized Data},
author = {Hanwen Jiang and Zexiang Xu and Desai Xie and Ziwen Chen and Haian Jin and Fujun Luan and Zhixin Shu and Kai Zhang and Sai Bi and Xin Sun and Jiuxiang Gu and Qixing Huang and Georgios Pavlakos and Hao Tan},
journal= {arXiv preprint arXiv:2412.14166},
year = {2025}
}
备注
Project page: https://hwjiang1510.github.io/MegaSynth/