DSplats:基于 Splat 去噪的多视图扩散模型 3D 生成
图像与视频处理
2024-12-16 v1 计算机视觉与模式识别
图形学
机器学习
摘要
生成高质量的 3D 内容需要能够学习复杂场景和其中真实物体分布的模型。最近的高斯基 3D 重建技术在从稀疏输入图像中预测 3D 高斯以前向方式恢复高保真度 3D 资产方面取得了令人印象的成果。然而,这些技术往往缺乏扩散模型提供的广泛先验和表达能力。相反,已成功应用于去噪多视图图像的 2D 扩散模型显示出生成广泛光照下逼真 3D 输出的潜力,但仍不足以提供显式的 3D 先验和一致性。在本工作中,我们旨在桥接这两种方法,通过引入 DSplats,一种直接使用高斯 Splat 重构器去噪多视图图像以产生多样化的逼真 3D 资产的新方法。为充分利用 2D 扩散模型的广泛先验,我们将预训练的潜在扩散模型整合到重构器主干中,用于预测一组 3D 高斯。此外,去噪网络中嵌入的显式 3D 表示提供了强大的归纳偏置,确保几何上一致的新视角生成。我们的定性和定量实验表明,DSplats 不仅产生高质量、在空间上一致的输出,还在单图像到 3D 重建方面树立了新的标准。在 Google Scanned Objects 数据集上评估时,DSplats 实现了 PSNR 为 20.38、SSIM 为 0.842、LPIPS 为 0.109。
引用
@article{arxiv.2412.09648,
title = {DSplats: 3D Generation by Denoising Splats-Based Multiview Diffusion Models},
author = {Kevin Miao and Harsh Agrawal and Qihang Zhang and Federico Semeraro and Marco Cavallo and Jiatao Gu and Alexander Toshev},
journal= {arXiv preprint arXiv:2412.09648},
year = {2024}
}