中文

通过提示消除刻板印象?评估文本到图像模型中的职业偏见

计算与语言 2025-09-03 v1

摘要

文本到图像 (TTI) 模型是强大的创意工具,但存在放大有害社会偏见的风险。我们将表征性社会偏见评估构建为一个图像策展与评估任务,并引入一个涵盖五种具有社会显著性的角色(CEO、护士、软件工程师、教师、运动员)的职业描绘试点基准。使用五种最先进的模型:闭源模型 (DALLE 3, Gemini Imagen 4.0) 和开源模型 (FLUX.1-dev, Stable Diffusion XL Turbo, Grok-2 Image),我们比较了中性基线提示与旨在鼓励人口统计多样性的公平感知控制提示。所有输出都标注了性别(男性、女性)和种族(亚洲人、黑人、白人),从而能够进行结构化的分布分析。结果表明,提示可以显著改变人口统计表征,但具有高度模型特异性的效果:一些系统能有效实现多样化,另一些则过度纠正为不切实际的均匀性,还有一些则反应甚微。这些发现突显了提示作为公平性干预手段的前景与局限,强调了补充性模型层面策略的必要性。我们公开所有代码和数据以确保透明度和可复现性:https://github.com/maximus-powers/img-gen-bias-analysis。

关键词

引用

@article{arxiv.2509.00849,
  title  = {Prompting Away Stereotypes? Evaluating Bias in Text-to-Image Models for Occupations},
  author = {Shaina Raza and Maximus Powers and Partha Pratim Saha and Mahveen Raza and Rizwan Qureshi},
  journal= {arXiv preprint arXiv:2509.00849},
  year   = {2025}
}