RodinHD:基于扩散模型的高保真 3D 头像生成
计算机视觉与模式识别
2024-07-12 v2
摘要
我们提出了 RodinHD,可从肖像图像生成高保真 3D 头像。现有方法难以捕捉如发型等细微细节,这一问题本文予以解决。我们首先识别了一个被忽视的问题:当在多个头像上依次拟合 triplanes 时,由于 MLP 解码器共享机制,导致恶性遗忘现象。为克服此问题,我们提出了新颖的数据调度策略和权重合并正则化项,提高了解码器渲染更锐利细节的能力。此外,我们优化了肖像图像的引导效果,通过计算更细粒度的分层表征来捕获丰富的 2D 纹理线索,并通过跨注意力机制将其注入 3D 扩散模型的多个层。训练于 46K 张头像,配合为 triplanes 优化的噪声计划后,生成的模型能够生成细节显著优于先前方法的 3D 头像,并且能对野外肖像输入实现泛化。
引用
@article{arxiv.2407.06938,
title = {RodinHD: High-Fidelity 3D Avatar Generation with Diffusion Models},
author = {Bowen Zhang and Yiji Cheng and Chunyu Wang and Ting Zhang and Jiaolong Yang and Yansong Tang and Feng Zhao and Dong Chen and Baining Guo},
journal= {arXiv preprint arXiv:2407.06938},
year = {2024}
}
备注
ECCV 2024; project page: https://rodinhd.github.io/