MVD-HuGaS: 基于 3D 人体多视角扩散先验的单图像人体高斯重建
计算机视觉与模式识别
2025-03-12 v1
摘要
从单张图像进行 3D 人体重建是一项具有挑战性的问题,此前的研究已对此进行了广泛探讨。最近,一些方法借助扩散模型进行引导,通过分数蒸馏采样(Score Distillation Sampling, SDS)优化 3D 表示,或生成一张后视图图像以辅助重建。然而,这些方法倾向于产生不令人满意的伪影(例如扁平化的人体结构或由多视角不一致先验导致的过度平滑结果),并且在真实世界泛化方面存在困难。在本工作中,我们提出 MVD-HuGaS,通过多视角人体扩散模型实现从单张图像的自由视角 3D 人体渲染。我们首先利用增强的多视角扩散模型从单张参考图像生成多视角图像,该模型在高质量 3D 人体数据集上进行了良好微调,以融入 3D 几何先验和人体结构先验。为从稀疏生成的多视角图像中推断准确的相机姿态以进行重建,我们引入了一个对齐模块,以促进 3D 高斯与相机姿态的联合优化。此外,我们提出了一种基于深度的面部形变缓解模块,用于细化生成的面部区域,从而提高重建的整体保真度。最后,利用经过细化的多视角图像及其准确的相机姿态,MVD-HuGaS 优化目标人体的 3D 高斯,以实现高保真度的自由视角渲染。在 Thuman2.0 和 2K2K 数据集上的大量实验表明,所提出的 MVD-HuGaS 在单视角 3D 人体渲染方面达到了最先进的性能。
引用
@article{arxiv.2503.08218,
title = {MVD-HuGaS: Human Gaussians from a Single Image via 3D Human Multi-view Diffusion Prior},
author = {Kaiqiang Xiong and Ying Feng and Qi Zhang and Jianbo Jiao and Yang Zhao and Zhihao Liang and Huachen Gao and Ronggang Wang},
journal= {arXiv preprint arXiv:2503.08218},
year = {2025}
}