中文

利用多视图扩散先验与高斯溅射桥接几何一致的文本到三维生成

计算机视觉与模式识别 2025-12-23 v2

摘要

分数蒸馏采样 (SDS) 利用预训练的 2D 扩散模型来推进文本到 3D 的生成,但忽略了多视图相关性,容易在生成的 3D 内容中产生几何不一致和多面伪影。在这项工作中,我们提出了耦合分数蒸馏 (CSD),这是一个耦合多视图联合分布先验的框架,以确保几何一致的 3D 生成,同时实现对 3D 高斯溅射 (3D-GS) 的稳定直接优化。具体来说,通过将优化问题重新表述为多视图联合优化问题,我们推导出一个有效的优化规则,该规则有效地耦合多视图先验以指导跨不同视点的优化,同时保持生成 3D 资产的多样性。此外,我们提出了一个框架,该框架通过随机初始化直接优化 3D 高斯溅射 (3D-GS),以生成几何一致的 3D 内容。我们进一步采用一个可变形四面体网格,该网格从 3D-GS 初始化并通过 CSD 细化,以生成高质量、精细的网格。定量和定性的实验结果证明了我们方法的效率和具有竞争力的质量。

关键词

引用

@article{arxiv.2505.04262,
  title  = {Bridging Geometry-Coherent Text-to-3D Generation with Multi-View Diffusion Priors and Gaussian Splatting},
  author = {Feng Yang and Wenliang Qian and Wangmeng Zuo and Hui Li},
  journal= {arXiv preprint arXiv:2505.04262},
  year   = {2025}
}

备注

Accepted by Neural Networks. The final published version is available at https://doi.org/10.1016/j.neunet.2025.108511