FairT2I:通过大语言模型辅助检测和属性重平衡缓解文本到图像生成中的社会偏见
计算机视觉与模式识别
2026-01-08 v4
摘要
文本到图像(T2I)模型推动了创意内容生成的发展,然而它们对大型未经整理数据集的依赖往往会再现社会偏见。我们提出了FairT2I,一个无需训练且可交互的框架,该框架基于数学原理化的潜变量引导公式。该公式将生成评分函数分解为属性条件分量,并根据定义的分布重新加权,为偏见感知生成提供了一个统一且灵活的机制,同时也将许多现有的临时去偏方法作为特例包含在内。在此基础上,FairT2I整合了:(1)作为核心机制的潜变量引导;(2)基于LLM的偏见检测,作为潜结构的一部分,自动从文本提示中推断易产生偏见的类别和属性;以及(3)属性重采样,允许用户根据均匀分布、真实世界统计或用户指定的统计来调整或重新定义属性分布。配套的用户界面支持此流程,使用户能够检查检测到的偏见、修改属性或权重,并实时生成去偏图像。实验结果表明,LLM在检测到的偏见类别和属性的数量及粒度上优于普通人类标注者。此外,FairT2I在社会偏见缓解和图像多样性方面均取得了优于基线模型的性能,同时保持了图像质量和提示保真度。
引用
@article{arxiv.2502.03826,
title = {FairT2I: Mitigating Social Bias in Text-to-Image Generation via Large Language Model-Assisted Detection and Attribute Rebalancing},
author = {Jinya Sakurai and Yuki Koyama and Issei Sato},
journal= {arXiv preprint arXiv:2502.03826},
year = {2026}
}