FairQueue:面向公平文本到图像生成的提示学习方法
计算机视觉与模式识别
2024-10-25 v1 人工智能
摘要
最近,提示学习 emerged as the state-of-the-art (SOTA) for fair text-to-image (T2I) generation。具体而言,这种方法利用可获得的参考图像为每个目标敏感属性 (tSA) 学习包容性提示,以实现公平图像生成。本文首先揭示了这种提示学习方法会导致样本质量下降。我们的分析表明,该方法的训练目标——旨在对齐所学习提示与参考图像的嵌入差异——可能次优,导致所学提示产生失真,进而使生成图像质量下降。为进一步论证此观点,我们深入分析 T2I 模型的去噪子网络,通过分析交叉注意力图来跟踪这些所学提示的影响。我们提出了一种新颖的提示切换分析:I2H 和 H2I。此外,我们对交叉注意力图提出了新的定量特征描述。我们的分析揭示了在早期去噪步骤中存在异常情况,这会持续不当的全局结构,导致生成样本质量下降。基于我们的分析洞见,我们提出了两种想法:(i) 提示队列 和 (ii) 注意力放大。广泛的实验结果表明,我们的方法在广泛的 tSA 上实现了优于 SOTA 方法的图像生成质量,同时在公平性方面保持竞争力。更多资源请访问 FairQueue 项目站点:https://sutd-visual-computing-group.github.io/FairQueue
引用
@article{arxiv.2410.18615,
title = {FairQueue: Rethinking Prompt Learning for Fair Text-to-Image Generation},
author = {Christopher T. H Teo and Milad Abdollahzadeh and Xinda Ma and Ngai-man Cheung},
journal= {arXiv preprint arXiv:2410.18615},
year = {2024}
}
备注
Accepted in NeurIPS24