中文

利用对比嵌入和 SegFormer 引导增强扩散人脸生成

计算机视觉与模式识别 2025-08-14 v1

摘要

我们在小规模 CelebAMask-HQ 数据集上提出了一个用于人脸生成的扩散模型基准,评估了无条件生成和条件生成流程。我们的研究比较了 UNet 和 DiT 架构用于无条件生成,并作为独立实验探索了基于 LoRA 的预训练 Stable Diffusion 模型微调。基于 Giambi 和 Lisanti 同时使用属性向量和分割掩码的多条件方法,我们的主要贡献是集成了用于属性嵌入的 InfoNCE 损失,并采用了基于 SegFormer 的分割编码器。这些增强改进了属性引导合成的语义对齐和可控性。我们的结果突显了对比嵌入学习和先进分割编码在有限数据环境下进行可控人脸生成的有效性。

关键词

引用

@article{arxiv.2508.09847,
  title  = {Enhancing Diffusion Face Generation with Contrastive Embeddings and SegFormer Guidance},
  author = {Dhruvraj Singh Rawat and Enggen Sherpa and Rishikesan Kirupanantha and Tin Hoang},
  journal= {arXiv preprint arXiv:2508.09847},
  year   = {2025}
}

备注

10 pages, preprint