中文

用于单图像生成多视角一致3D的几何与感知引导高斯

计算机视觉与模式识别 2025-10-21 v3

摘要

从单视角图像生成逼真的3D物体需要自然的外观、3D一致性,以及捕捉未见区域多种合理解释的能力。现有方法通常依赖于微调预训练的2D扩散模型,或通过快速网络推理或3D Gaussian Splatting直接生成3D信息,但其结果通常存在多视角一致性差和缺乏几何细节的问题。为了解决这些问题,我们提出了一种新方法,该方法无需额外模型训练即可将几何与感知信息无缝集成,从而从单图像重建详细的3D物体。具体而言,我们结合几何与感知先验来初始化高斯分支并指导其参数优化。几何先验捕捉粗略的3D形状,而感知先验利用2D预训练扩散模型来增强多视角信息。随后,我们引入了一种稳定的Score Distillation Sampling用于细粒度先验蒸馏,以确保有效的知识迁移。该模型进一步通过基于重投影的策略得到增强,该策略强制执行深度一致性。实验结果表明,我们在新视角合成和3D重建上优于现有方法,展示了鲁棒且一致的3D物体生成。

关键词

引用

@article{arxiv.2506.21152,
  title  = {Geometry and Perception Guided Gaussians for Multiview-consistent 3D Generation from a Single Image},
  author = {Pufan Li and Bi'an Du and Wei Hu},
  journal= {arXiv preprint arXiv:2506.21152},
  year   = {2025}
}

备注

10 pages, 5 figures