中文

StdGEN:从单张图像生成语义分解的 3D 角色

计算机视觉与模式识别 2025-03-06 v2

摘要

我们提出了 StdGEN,一个从单张图像生成语义分解的高质量 3D 角色的创新流水线,适用于虚拟现实、游戏和电影制作等广泛领域。与先前在可分解性、质量和优化时间方面存在局限的方法不同,StdGEN 具备可分解性、有效性和高效性;即它在三分钟内生成具有分离语义组件(如身体、衣服和头发)的精细 3D 角色。StdGEN 的核心是我们提出的语义感知大重建模型(S-LRM),一种基于变换器的可泛化模型,以全前馈方式从多视角图像联合重建几何、颜色和语义。引入了一种可微分多层语义表面提取方案,从 S-LRM 重建的混合隐式场中获取网格。此外,一个专门的高效多视角扩散模型和一个迭代多层表面细化模块被集成到流水线中,以促进高质量、可分解的 3D 角色生成。大量实验证明了我们在 3D 动漫角色生成中的最先进性能,在几何、纹理和可分解性方面显著超越了现有基线。StdGEN 提供开箱即用的语义分解 3D 角色,并支持广泛应用的灵活定制。项目页面:https://stdgen.github.io

关键词

引用

@article{arxiv.2411.05738,
  title  = {StdGEN: Semantic-Decomposed 3D Character Generation from Single Images},
  author = {Yuze He and Yanning Zhou and Wang Zhao and Zhongkai Wu and Kaiwen Xiao and Wei Yang and Yong-Jin Liu and Xiao Han},
  journal= {arXiv preprint arXiv:2411.05738},
  year   = {2025}
}

备注

CVPR 2025. 13 pages, 10 figures