中文

ID-to-3D:通过分数蒸馏采样实现富有表现力的身份引导三维头部生成

计算机视觉与模式识别 2024-05-29 v2 人工智能

摘要

我们提出了ID-to-3D,一种从单张随意拍摄的野外图像开始,生成具有解耦表情的身份和文本引导的三维人头的方法。我们方法的基础在于组合性,以及使用任务特定的二维扩散模型作为优化先验。首先,我们通过一个轻量级的表情感知和身份感知架构扩展了一个基础模型,并通过仅微调其0.2%的可训练参数,为几何和纹理生成创建了二维先验。然后,我们联合利用每个主体的表情的神经参数化表示,以及高度详细的几何和反照率纹理的多阶段生成。这种强大的面部身份嵌入与我们的神经表示相结合,不仅能够准确重建面部特征,还能重建配饰和头发,并且可以网格化,为游戏和远程呈现提供可渲染的资产。我们的结果在身份一致性和高质量纹理及几何生成方面达到了前所未有的水平,能够泛化到未见过的三维身份的“世界”,而无需依赖大规模的三维人体资产捕获数据集。

关键词

引用

@article{arxiv.2405.16570,
  title  = {ID-to-3D: Expressive ID-guided 3D Heads via Score Distillation Sampling},
  author = {Francesca Babiloni and Alexandros Lattas and Jiankang Deng and Stefanos Zafeiriou},
  journal= {arXiv preprint arXiv:2405.16570},
  year   = {2024}
}

备注

Explore our 3D results at: https://idto3d.github.io ; fixed broken url to project page