中文

PSTF-AttControl:无主体调谐个性化图像生成方法及可控面部属性

计算机视觉与模式识别 2025-10-30 v1

摘要

近期个性化图像生成技术的进展显著提升了面部身份保持效果,尤其在娱乐和社交媒体等领域表现突出。然而,现有方法仍难以以无主体调谐(Per-Subject-Tuning-Free,PSTF)方式实现精确的面部属性控制。基于调谐的技术如 PreciseControl 虽能提供面部特征的细粒度控制,但往往需要大量技术专长和额外的训练数据,限制了其可及性。相比之下,PSTF 方法通过单张面部输入即可实现图像生成,但缺乏对面部属性的精确控制。本文提出一种新型 PSTF 方法,既能实现面部属性的精确控制,又能保持面部身份的高保真度。该方法利用面部识别模型提取面部身份特征,再通过 e4e 编码器将其映射到 StyleGAN2 的 W+W^+ 潜在空间。我们进一步引入 Triplet-Decoupled Cross-Attention 模块,将面部身份、属性特征与文本嵌入整合到 UNet 架构中,确保身份与属性信息的干净分离。该方法在 FFHQ 数据集上训练,无需为 individual identities 进行额外微调或训练数据,即可生成具有细粒度面部属性控制能力的个性化图像。我们展示了该方法成功实现了个性化与精确面部属性控制之间的平衡,为高质量、可适应的人脸图像合成提供了更高效和用户友好的解决方案。代码已公开于 https://github.com/UnicomAI/PSTF-AttControl。

关键词

引用

@article{arxiv.2510.25084,
  title  = {PSTF-AttControl: Per-Subject-Tuning-Free Personalized Image Generation with Controllable Face Attributes},
  author = {Xiang liu and Zhaoxiang Liu and Huan Hu and Zipeng Wang and Ping Chen and Zezhou Chen and Kai Wang and Shiguo Lian},
  journal= {arXiv preprint arXiv:2510.25084},
  year   = {2025}
}

备注

Accepted by Image and Vision Computing (18 pages, 8 figures)