DiffLocks:使用扩散模型从单张图像生成三维头发
计算机视觉与模式识别
2025-05-12 v1
摘要
我们致力于解决从单张图像生成三维头发几何结构的任务,由于发型的多样性和缺乏成对的图像到三维头发数据,该任务极具挑战性。以往方法主要在合成数据上训练,并通过使用低维中间表示(如引导发束和头皮级嵌入)来应对此类数据量有限的问题,这些表示需要后处理来解码、上采样和增加真实感。这些方法无法重建细节丰富的头发,难以处理卷发,或仅限于处理少数几种发型。为克服这些局限,我们提出 DiffLocks,这是一个新颖的框架,能够直接从单张图像中精细重建各种发型。首先,我们通过自动化创建迄今为止最大的合成头发数据集(包含 4 万种发型)来解决三维头发数据匮乏的问题。其次,我们利用该合成头发数据集学习一个以图像为条件的扩散变换器模型,该模型能从单张正面图像生成精确的三维发丝。通过使用预训练的图像骨干网络,尽管仅在合成数据上训练,我们的方法也能泛化到自然图像。我们的扩散模型预测一个头皮纹理图,图中任何一点都包含单根发丝的潜在编码。这些编码可直接解码为三维发丝,无需后处理技术。表示单根发丝而非引导发束,使变换器能够对复杂发型的详细空间结构进行建模。凭借此,DiffLocks 首次能够从单张图像恢复高度卷曲的头发,如非洲式发型。数据和代码可在 https://radualexandru.github.io/difflocks/ 获取。
引用
@article{arxiv.2505.06166,
title = {DiffLocks: Generating 3D Hair from a Single Image using Diffusion Models},
author = {Radu Alexandru Rosu and Keyu Wu and Yao Feng and Youyi Zheng and Michael J. Black},
journal= {arXiv preprint arXiv:2505.06166},
year = {2025}
}
备注
Accepted to CVPR 2025