中文

Zero-1-to-G:利用预训练 2D 扩散模型实现直接 3D 生成

计算机视觉与模式识别 2025-01-10 v1

摘要

2D 图像生成近年来取得了显著的进展,这主要得益于扩散模型的能力以及大规模数据集的可用性。然而,直接 3D 生成仍受限于 3D 数据集的稀缺性和较低的保真度。本文提出 Zero-1-to-G,一种通过利用预训练 2D 扩散模型在 Gaussian splats 上实现直接单视图生成的新方法。我们的核心洞见在于:作为一种 3D 表示,Gaussian splats 可以被分解为编码不同属性的多视图图像。这将具有挑战性的直接 3D 生成任务重新置于 2D 扩散框架内,从而使我们能够利用预训练 2D 扩散模型丰富的先验知识。为引入 3D 感知能力,我们引入了跨视图和跨属性注意力层,以捕捉复杂的相关性并强制生成 splats 之间的 3D 一致性。这使得 Zero-1-to-G 成为首个有效利用预训练 2D 扩散先验的直接图像到 3D 生成模型,实现了高效训练并提升了对未见对象的泛化能力。在合成数据集和真实世界数据集上的大量实验表明,该方法在 3D 物体生成方面具有卓越性能,为高质量 3D 生成提供了一种新途径。

关键词

引用

@article{arxiv.2501.05427,
  title  = {Zero-1-to-G: Taming Pretrained 2D Diffusion Model for Direct 3D Generation},
  author = {Xuyi Meng and Chen Wang and Jiahui Lei and Kostas Daniilidis and Jiatao Gu and Lingjie Liu},
  journal= {arXiv preprint arXiv:2501.05427},
  year   = {2025}
}