中文

多模态引导的双扩散模型3D化身生成

计算机视觉与模式识别 2026-03-05 v1

摘要

从文本或图像提示生成高保真3D化身是虚拟现实和人机交互中亟需解决的挑战。然而,现有文本驱动方法常依赖迭代的得分蒸馍采样(SDS)或CLIP优化,难以实现细粒度语义控制且推理速度极慢。另一方面,图像驱动方法因高质量3D面部扫描稀缺和获取成本高,限制了模型的泛化能力。为解决这些问题,我们首先构建了一个新型大规模数据集,包含超过10万组四模态数据:细粒度文本描述、野外人脸图像、高质量光照正规化纹理UV图以及3D几何形状。基于这个全面的数据集,我们提出了PromptAvatar框架,其集成双扩散模型。具体而言,它整合了支持文本和/或图像提示的多条件引导的纹理扩散模型(TDM),以及由文本提示引导的几何扩散模型(GDM)。通过学习从多模态提示到3D表示的直接映射,PromptAvatar消除了耗时的迭代优化,成功在10秒内生成高保真、无阴影的3D化身。大量定量和定性实验表明,本方法在生成质量、细粒度细节对齐和计算效率方面显著优于现有最先进方法。

关键词

引用

@article{arxiv.2603.04307,
  title  = {Dual Diffusion Models for Multi-modal Guided 3D Avatar Generation},
  author = {Hong Li and Yutang Feng and Minqi Meng and Yichen Yang and Xuhui Liu and Baochang Zhang},
  journal= {arXiv preprint arXiv:2603.04307},
  year   = {2026}
}

备注

18 pages, 10 figures