中文

BiasIG: 面向文本到图像模型的多维社会偏见基准

计算机与社会 2026-04-15 v1

摘要

文本到图像 (T2I) 生成模型已彻底革新了内容创建,但本质上存在放大社会偏见的风险。虽然社会学研究提供了系统的偏见分类,但现有 T2I 基准大多混合这些细微差别或仅关注职业刻板印象,未能充分衡量生成式偏见的多维本质。本文我们引入 BiasIG,一个统一的基准,用于对 47,040 个提示词中的社会偏见进行量化。基于社会学和机器伦理框架,BiasIG 在四个维度上分离偏见,以实现细粒度诊断。为实现可扩展且可靠的评估,我们提出了一个由微调的多模态大型语言模型驱动的全自动管道,实现了与人类专家相当的高对齐准确率。对 8 个 T2I 模型和 3 个去偏方法进行大规模实验不仅验证了 BiasIG 作为强大的诊断工具,也揭示了关键见解:针对受保护属性的干预常常会触发对无关人口的意外混淆效应,去偏方法存在一种持久的倾向于歧视而非仅仅忽视的趋势。我们的工作主张采用精确的、以分类为导向的公平性方法,为使用 BiasIG 的指标作为未来闭环缓解的反馈信号提供了理论框架。该基准已在 https://github.com/Astarojth/BiasIG 上公开。

关键词

引用

@article{arxiv.2604.11934,
  title  = {BiasIG: Benchmarking Multi-dimensional Social Biases in Text-to-Image Models},
  author = {Hanjun Luo and Zhimu Huang and Haoyu Huang and Ziye Deng and Ruizhe Chen and Xinfeng Li and Zuozhu Liu and Hanan Salam},
  journal= {arXiv preprint arXiv:2604.11934},
  year   = {2026}
}

备注

Accepted by IJCNN 2026