将高斯溅写入扩散去噪器用于快速且可扩展的单阶段图像到 3D 生成与重建
计算机视觉与模式识别
2025-10-14 v5 图形学
摘要
现有的前馆图像到 3D 方法主要依赖 2D 多视角扩散模型,无法保证 3D 一致性。这些方法在改变提示视角方向时容易崩溃,主要处理以物体为中心的情况。本文提出了一种新颖的单阶段 3D 扩散模型,即 DiffusionGS,用于从单视图进行物体生成和场景重建。DiffusionGS 在每个时间步直接输出 3D 高斯点云,以强制视角一致性,允许模型在给定任何方向的提示视图下进行稳健生成,超越物体中心化输入。此外,为了提高 DiffusionGS 的能力和通用性,我们通过发展场景-对象混合训练策略来扩大 3D 训练数据的规模。实验表明,DiffusionGS 在对象和场景方面分别比最先进的方法提高了 2.20 dB/23.25 和 1.34 dB/19.16 的 PSNR/FID,且无需深度估计器。此外,我们的方法速度快超过 (约 6s 在 A100 GPU 上)。我们的项目页面 https://caiyuanhao1998.github.io/project/DiffusionGS/ 显示了视频和交互式结果。代码和模型在 https://github.com/caiyuanhao1998/Open-DiffusionGS 上公开可用。
引用
@article{arxiv.2411.14384,
title = {Baking Gaussian Splatting into Diffusion Denoiser for Fast and Scalable Single-stage Image-to-3D Generation and Reconstruction},
author = {Yuanhao Cai and He Zhang and Kai Zhang and Yixun Liang and Mengwei Ren and Fujun Luan and Qing Liu and Soo Ye Kim and Jianming Zhang and Zhifei Zhang and Yuqian Zhou and Yulun Zhang and Xiaokang Yang and Zhe Lin and Alan Yuille},
journal= {arXiv preprint arXiv:2411.14384},
year = {2025}
}
备注
ICCV 2025; A novel one-stage 3DGS-based diffusion for 3D object generation and scene reconstruction from a single view in ~6 seconds