Rodin:基于扩散模型雕刻 3D 数字虚拟人的生成模型
计算机视觉与模式识别
2022-12-13 v1
摘要
本文提出一种 3D 生成模型,利用扩散模型自动生成以神经辐射场表示的 3D 数字虚拟人。生成此类虚拟人的一个重大挑战是,3D 中的内存与计算成本对于生成高质量虚拟人所需的丰富细节而言难以承受。为解决该问题,我们提出卷展扩散网络(Rodin),其将神经辐射场表示为多个 2D 特征图,并将这些特征图卷展为单个 2D 特征平面,在该平面内执行 3D 感知的扩散。Rodin 模型通过使用 3D 感知卷积(依据原始 3D 关系关注 2D 特征平面中的投影特征)来保持 3D 扩散的完整性,同时带来了亟需的计算效率。我们还使用隐空间条件调制来协调特征生成以实现全局一致性,从而生成高保真虚拟人并支持基于文本提示的语义编辑。最后,我们使用分层合成进一步增强细节。我们的模型生成的 3D 虚拟人在质量上优于现有生成技术,可生成具有逼真发型与胡须等面部毛发的高度细致虚拟人。我们还展示了从图像或文本生成 3D 虚拟人以及文本引导的可编辑能力。
引用
@article{arxiv.2212.06135,
title = {Rodin: A Generative Model for Sculpting 3D Digital Avatars Using Diffusion},
author = {Tengfei Wang and Bo Zhang and Ting Zhang and Shuyang Gu and Jianmin Bao and Tadas Baltrusaitis and Jingjing Shen and Dong Chen and Fang Wen and Qifeng Chen and Baining Guo},
journal= {arXiv preprint arXiv:2212.06135},
year = {2022}
}
备注
Project Webpage: https://3d-avatar-diffusion.microsoft.com/