中文

SIGMAN:规模化的 3D 人类高斯生成方法

计算机视觉与模式识别 2025-04-10 v1

摘要

3D 人类数字化一直是高度追求却富具挑战性的任务。现有方法旨在从单视图或多视图生成高质量的 3D 虚拟人物,但主要受限于当前方法论和 3D 人类资产的稀缺。具体而言,最近的研究方法归结为几种范式:优化导向和前馈(均为单视图回归和多视图生成带重建)。然而,这些方法受限于速度慢、质量低、级联推理以及由于遮挡和不可见性导致的从低维平面到高维空间的映射模糊。此外,现有的 3D 人类资产规模较小,不足以支持大规模训练。为此,我们提出一种用于 3D 人类数字化的潜在空间生成范式,通过 UV 结构变分自编码器将多视图图像压缩为高斯分布,结合基于 DiT 的条件生成,我们将这个难以解决的低维到高维映射问题转化为可学习的分布偏移问题,这也支持端到端推理。此外,我们采用多视图优化方法结合合成数据构建了 HGS-1M 数据集,其中包含 100 万个 3D 高斯资产,以支持大规模训练。实验结果表明,我们的方法在大规模训练驱动下,能够生成具有精细纹理、面部细节以及松散服装变形的高质量 3D 人类高斯。

关键词

引用

@article{arxiv.2504.06982,
  title  = {SIGMAN:Scaling 3D Human Gaussian Generation with Millions of Assets},
  author = {Yuhang Yang and Fengqi Liu and Yixing Lu and Qin Zhao and Pingyu Wu and Wei Zhai and Ran Yi and Yang Cao and Lizhuang Ma and Zheng-Jun Zha and Junting Dong},
  journal= {arXiv preprint arXiv:2504.06982},
  year   = {2025}
}

备注

project page:https://yyvhang.github.io/SIGMAN_3D/