中文

GLEaN:面向公共理解的文本到图像偏见检测方法

人工智能 2026-04-14 v1 计算机视觉与模式识别

摘要

文本到图像(T2I)模型及其编码的偏见日益影响公共所接触的视觉媒体。虽然研究者已在T2I系统中开展了丰富的偏见测量、审计和缓解工作,但这些方法大多针对技术利益相关者,留下了公共可读性的空白。我们引入GLEaN(Generative Likeness Evaluation at N-Scale),一个以肖像为基础的可解释性管道,旨在使T2I模型偏见对广大受众可视化理解。GLEaN包括三个阶段:从身份提示生成大规模图像、基于面部 landmarks 的过滤与空间对齐,以及中位数像素合成,将模型的中心趋势浓缩为单个代表性肖像。所得合成图像无需统计背景即可解读;观众可一目了然地看到,当提示"a doctor"时模型"想象"的是谁,与"a felon"时的情况。我们在Stable Diffusion XL上对40个社交和职业身份提示进行了演示,产生的合成图像复现了已有文献中的偏见并发现了肤色与预测情绪之间的新关联。在一项N=291的between-subjects用户研究中,我们发现GLEaN肖像传达偏见的效果等同于传统数据表格,但所需观看时间显著减少。由于该方法仅依赖生成输出,因此可在任何黑箱和封闭权重系统上复制,而无需访问模型内部。GLEaN提供了一种面向公共理解的可扩展、模型无关的偏见可解释性方法。项目已公开于https://github.com/cultureiolab/GLEaN。

关键词

引用

@article{arxiv.2604.09923,
  title  = {GLEaN: A Text-to-image Bias Detection Approach for Public Comprehension},
  author = {Bochu Ding and Brinnae Bent and Augustus Wendell},
  journal= {arXiv preprint arXiv:2604.09923},
  year   = {2026}
}