HoloFair:统一的文本到图像公平性评估与 Fair-GRPO 去偏
计算机视觉与模式识别
2026-05-26 v1 人工智能
摘要
文本到图像(T2I)模型在视觉逼真度和语义一致性方面取得了显著进步,但往往延续并放大社会偏见。现有评估方法通常仅针对单一维度的偏见,缺乏发现模型在社会相关深层语义水平上偏见的视角。我们引入 HoloFair,一个用于多维人口统计偏见分析的全面基准框架。基于我们大规模面向公平性构建的数据集和 SpaFreq(空间-频率)属性分类器,该框架提出了 Multi-attribute, Group-wise Bias Index(MGBI)指标,用于评估内在多样性和条件偏见。除评估外,我们进一步引入 Fair-GRPO,一种基于强化学习的去偏方法,通过设计的多目标奖励函数改变生成模型的分布。例如,在 SD3.5-Medium 模型上进行实验表明,Fair-GRPO 在保持高图像质量的同时显著提升了多维公平性。我们还分析了潜在的奖励攻击现象并提供相应的缓解策略。代码和数据集已提供于 https://github.com/1059684669/HoloFair。
引用
@article{arxiv.2605.24687,
title = {HoloFair: Unified T2I Fairness Evaluation and Fair-GRPO Debiasing},
author = {Ruyi Chen and Lu Zhou and Xiaogang Xu and Chiyu Zhang and Jiafei Wu and Liming Fang},
journal= {arXiv preprint arXiv:2605.24687},
year = {2026}
}
备注
Accepted to ICML 2026. Code and dataset are available at https://github.com/1059684669/HoloFair