中文

CrowdGaussian:从单张图像重建人群的高保真 3D 高斯

计算机视觉与模式识别 2026-03-24 v2

摘要

单视图 3D 人类重建近年来引起了广泛关注。尽管众多进展取得了显著成果,但以清晰、近距离的个体主体图像为目标的先前研究在更常见的多人场景中往往效果不佳。重建 3D 人类群体模型是一个高度复杂的任务,面临诸多挑战,包括:1) 大量遮挡、2) 图像清晰度低、3) 数量众多且外观各异。为解决这一任务,我们提出 CrowdGaussian,一个统一框架,直接从单图像输入重建多人 3D 高斯溅写 (3DGS) 表示。为处理遮挡,我们设计了一个自监督适应管道,使预训练的大型人类模型能够从严重遮挡的输入中重建具有合理几何和外观的完整人类。此外,我们引入自校准学习 (SCL)。该训练策略使单步骤扩散模型能够通过融合身份保持样本与干净/损坏图像对,适应性地细化粗糙渲染以获得最佳质量。输出可用于蒸馊,以提高多人 3DGS 表示的质量。大量实验表明,CrowdGaussian 能够生成多人场景的照片逼真、几何一致的重建。

关键词

引用

@article{arxiv.2603.17779,
  title  = {CrowdGaussian: Reconstructing High-Fidelity 3D Gaussians for Human Crowd from a Single Image},
  author = {Yizheng Song and Yiyu Zhuang and Qipeng Xu and Haixiang Wang and Jiahe Zhu and Jing Tian and Siyu Zhu and Hao Zhu},
  journal= {arXiv preprint arXiv:2603.17779},
  year   = {2026}
}

备注

Accepted by CVPR 2026