StyleAvatar3D:利用图文扩散模型生成高保真 3D 头像
计算机视觉与模式识别
2023-06-01 v2 人工智能
摘要
近期图文扩散模型的进展激发了人们对大规模 3D 生成模型的研究兴趣。然而,多样化 3D 资源的有限可用性给学习带来了重大挑战。本文提出一种生成高质量风格化 3D 头像的新方法,利用预训练图文扩散模型进行数据生成,并采用基于生成对抗网络(GAN)的 3D 生成网络进行训练。我们的方法借助图文扩散模型提供的外观与几何全面先验,生成多种风格的头像多视图图像。在数据生成过程中,我们使用从现有 3D 模型提取的姿势来引导多视图图像生成。为解决数据中姿势与图像错位的问题,我们研究视图特定提示并开发用于 GAN 训练的由粗到细判别器。我们还深入探讨属性相关提示以增加生成头像的多样性。此外,我们在 StyleGAN 的风格空间内开发了潜在扩散模型,以实现基于图像输入的头像生成。我们的方法在生成头像的视觉质量和多样性上均优于当前最先进的方法。
引用
@article{arxiv.2305.19012,
title = {StyleAvatar3D: Leveraging Image-Text Diffusion Models for High-Fidelity 3D Avatar Generation},
author = {Chi Zhang and Yiwen Chen and Yijun Fu and Zhenglin Zhou and Gang YU and Billzb Wang and Bin Fu and Tao Chen and Guosheng Lin and Chunhua Shen},
journal= {arXiv preprint arXiv:2305.19012},
year = {2023}
}
备注
Project page: https://github.com/icoz69/StyleAvatar3D