DivAvatar: 单提示生成多样化 3D 头像
计算机视觉与模式识别
2024-02-28 v1
摘要
文本到头像生成最近因扩散模型的进步而取得显著进展。然而,大多数现有工作受限于多样性有限,为给定文本提示生成的头像仅在外观上有细微差异。我们设计了 DivAvatar,一种新型框架,生成多样化头像,使 3D 创作者能够从单个文本提示中生成大量 distinct and 富有多样性的 3D 头像。与大多数现有工作使用场景特定 3D 表示(如 NeRF)不同,DivAvatar 对 3D 生成模型(即 EVA3D)进行微调,允许仅通过噪声采样在推理阶段实现多样化头像生成。DivAvatar 包含两个关键设计,帮助实现生成的多样性和视觉质量。第一个是在训练阶段使用的噪声采样技术,对生成多样化外观至关重要。第二个是语义感知的缩放机制和新颖的深度损失,前者通过对特定身体部位进行独立微调来实现高文本保真度外观,后者通过平滑特征空间中的生成网格来显著提高几何质量。广泛的实验表明,DivAvatar 在生成多样化外观的头像方面具有高度的灵活性。
引用
@article{arxiv.2402.17292,
title = {DivAvatar: Diverse 3D Avatar Generation with a Single Prompt},
author = {Weijing Tao and Biwen Lei and Kunhao Liu and Shijian Lu and Miaomiao Cui and Xuansong Xie and Chunyan Miao},
journal= {arXiv preprint arXiv:2402.17292},
year = {2024}
}