GAS:从单张图像生成生成式头像
计算机视觉与模式识别
2025-08-05 v2
摘要
我们提出了一个统一且可泛化的框架,用于从单张图像生成视图一致且时序连贯的头像,解决了单图像头像生成的挑艰任务。现有基于扩散的方法通常仅基于稀疏的人类模板(如深度图或法线图)进行条件控制,导致多视图和时序不一致,由于这些信号与被测主体真实外观之间的不匹配。我们的做法通过结合基于回归的 3D 人体重建能力与扩散模型的生成能力来弥合这一差距。首先,一个通过广义 NeRF 实现的初始 3D 人体重建提供全面的条件,确保合成结果在忠实于参考外观和结构方面具有高质量。随后,由广义 NeRF 提取的几何与外观特征作为输入喂入基于视频的扩散模型。这种战略性集成对于在头像生成过程中强制实现多视图和时序一致性至关重要。实验结果表明,我们提出的方法在 diverse in-domain 和 out-of-domain in-the-wild 数据集上展现了卓越的泛化能力。
引用
@article{arxiv.2502.06957,
title = {GAS: Generative Avatar Synthesis from a Single Image},
author = {Yixing Lu and Junting Dong and Youngjoong Kwon and Qin Zhao and Bo Dai and Fernando De la Torre},
journal= {arXiv preprint arXiv:2502.06957},
year = {2025}
}
备注
ICCV 2025; Project Page: https://humansensinglab.github.io/GAS/