MIST:在文本到图像扩散模型中通过解耦交叉注意力编辑缓解交叉偏见
计算机视觉与模式识别
2024-04-01 v1
摘要
基于扩散的文本到图像模型因其能够从文本描述生成详细且逼真的图像而迅速普及。然而,这些模型往往反映了其训练数据中存在的偏见,尤其是对边缘化群体的影响。尽管先前消除语言模型偏见的努力集中在解决特定偏见(如种族或性别偏见),但解决交叉偏见的努力仍然有限。交叉偏见是指处于多重社会身份交叉点的个体所经历的独特偏见形式。解决交叉偏见至关重要,因为它会放大基于种族、性别和其他身份的歧视的负面影响。在本文中,我们提出了一种方法,通过以解耦的方式修改交叉注意力图,来解决基于扩散的文本到图像模型中的交叉偏见。我们的方法利用预训练的Stable Diffusion模型,无需额外的参考图像集,并保持未修改概念的原始质量。综合实验表明,我们的方法在缓解各种属性的单项偏见和交叉偏见方面均优于现有方法。我们公开了各种属性的源代码和去偏见模型,以促进生成式模型的公平性并支持进一步研究。
引用
@article{arxiv.2403.19738,
title = {MIST: Mitigating Intersectional Bias with Disentangled Cross-Attention Editing in Text-to-Image Diffusion Models},
author = {Hidir Yesiltepe and Kiymet Akdemir and Pinar Yanardag},
journal= {arXiv preprint arXiv:2403.19738},
year = {2024}
}