用于单图像生成多视角一致3D的几何与感知引导高斯
计算机视觉与模式识别
2025-10-21 v3
摘要
从单视角图像生成逼真的3D物体需要自然的外观、3D一致性,以及捕捉未见区域多种合理解释的能力。现有方法通常依赖于微调预训练的2D扩散模型,或通过快速网络推理或3D Gaussian Splatting直接生成3D信息,但其结果通常存在多视角一致性差和缺乏几何细节的问题。为了解决这些问题,我们提出了一种新方法,该方法无需额外模型训练即可将几何与感知信息无缝集成,从而从单图像重建详细的3D物体。具体而言,我们结合几何与感知先验来初始化高斯分支并指导其参数优化。几何先验捕捉粗略的3D形状,而感知先验利用2D预训练扩散模型来增强多视角信息。随后,我们引入了一种稳定的Score Distillation Sampling用于细粒度先验蒸馏,以确保有效的知识迁移。该模型进一步通过基于重投影的策略得到增强,该策略强制执行深度一致性。实验结果表明,我们在新视角合成和3D重建上优于现有方法,展示了鲁棒且一致的3D物体生成。
引用
@article{arxiv.2506.21152,
title = {Geometry and Perception Guided Gaussians for Multiview-consistent 3D Generation from a Single Image},
author = {Pufan Li and Bi'an Du and Wei Hu},
journal= {arXiv preprint arXiv:2506.21152},
year = {2025}
}
备注
10 pages, 5 figures