中文

无不公平失真的公平生成:基于无纠缠注意力的文本到图像生成去偏

计算机视觉与模式识别 2025-08-05 v2 人工智能

摘要

基于扩散的文本到图像(T2I)模型的最新进展实现了从文本生成高质量和照片级真实感图像。然而,它们通常表现出与性别、种族和社会经济地位相关的社会偏见,从而可能强化有害刻板印象并不以预期的方式塑造公众认知。虽然现有的偏见缓解方法展示了有效性,但它们经常遇到属性纠缠问题,即对与偏见相关属性(即目标属性)的调整无意中改变了与偏见无关的属性(即非目标属性),导致不良的分布偏移。为应对这一挑战,我们引入了无纠缠注意力(EFA),一种在偏见缓解过程中准确融入目标属性(如白人、黑人和亚裔)同时保留非目标属性(如背景)的方法。在推理时,EFA以相等概率随机采样目标属性,并调整选定层中的交叉注意力以融入采样属性,从而实现目标属性的公平分布。广泛的实验表明,EFA在缓解偏见的同时保留了非目标属性,从而保持了原始模型的输出分布和生成能力。

关键词

引用

@article{arxiv.2506.13298,
  title  = {Fair Generation without Unfair Distortions: Debiasing Text-to-Image Generation with Entanglement-Free Attention},
  author = {Jeonghoon Park and Juyoung Lee and Chaeyeon Chung and Jaeseong Lee and Jaegul Choo and Jindong Gu},
  journal= {arXiv preprint arXiv:2506.13298},
  year   = {2025}
}

备注

Accepted to ICCV 2025