Portrait3D:基于金字塔表示与 GAN 先验的文本导向高质量 3D 人像生成
计算机视觉与模式识别
2024-04-17 v1
摘要
现有基于神经渲染的文本到 3D 人像生成方法通常依赖人体几何先验和扩散模型以获得指导。然而,仅依赖几何信息会导致 Janus 问题、过饱和和过平滑等问题。我们提出 Portrait3D,一种新型神经渲染框架,采用新的联合几何-外观先验,以实现克服上述问题的文本到 3D 人像生成。为此,我们训练了一个 3D 人像生成器 3DPortraitGAN-Pyramid,作为稳健的先验。该生成器能够生成 360{\deg} 标准化 3D 人像,作为后续基于扩散的生成过程的起点。为缓解基于特征图的 3D 表示常被大多数 3D-感知 GAN 使用时产生的“网格状”伪影,我们将一种新型金字塔三网格 3D 表示集成到 3DPortraitGAN-Pyramid 中。用于从文本生成 3D 人像,我们首先将与给定提示对齐的随机生成图像投影到预训练的 3DPortraitGAN-Pyramid 潜在空间中。得到的潜在代码用于合成金字塔三网格。从获得的金字塔三网格开始,我们使用得分蒸馏采样将扩散模型的知识蒸馏到金字塔三网格中。随后,我们利用扩散模型细化 3D 人像的渲染图像,并将这些细化后的图像作为训练数据进一步优化金字塔三网格,从而有效消除不真实颜色和不自然伪影的问题。我们的实验结果表明,Portrait3D 能生成与提示一致的真实、高质量和标准化 3D 人像。
引用
@article{arxiv.2404.10394,
title = {Portrait3D: Text-Guided High-Quality 3D Portrait Generation Using Pyramid Representation and GANs Prior},
author = {Yiqian Wu and Hao Xu and Xiangjun Tang and Xien Chen and Siyu Tang and Zhebin Zhang and Chen Li and Xiaogang Jin},
journal= {arXiv preprint arXiv:2404.10394},
year = {2024}
}