谁定义公平性?面向人口统计代表性的目标导向提示
人工智能
2026-04-24 v1
摘要
文本到图像 (T2I) 模型如 Stable Diffusion 与 DALL-E 已使生成式 AI 广为人知,但近期研究表明,这些系统往往复制社会偏见,尤其是在如何描绘不同人口统计群体的职业方面。诸如 'doctor' 或 'CEO' 之类的提示经常产生偏白-skinned 输出,而低地位角色如 'janitor' 则显示出更多样化,强化了刻板印象。现有的缓解方法通常需要重新训练或使用精选数据集,因而难以普遍访问。我们提出一种轻量级、推理时框架,通过提示层面干预来缓解代表性偏见,而无需修改底层模型。该方法不假设单一的公平性定义,允许用户在多种公平性规范之间进行选择——从简单选择(如均匀分布)到受大型语言模型 (LLM) 启发的更复杂定义,后者会引用来源并提供置信度估计。这些分布指导构建特定人口统计的提示变量,按预期比例呈现。我们通过审计对齐度、衡量结果皮肤色分布来评估,而非假设均匀性即为 '公平性'。在涵盖 36 个提示、30 个职业及 6 个非职业情境的测试中,我们的方法将观察到的皮肤色结果偏移至符合所声明目标的方向,并在目标直接定义于皮肤色空间时(后备方案)减少目标偏差。本工作表明,公平性干预可在透明、可控且可在推理时使用的前提下实现,直接赋能生成式 AI 的用户。
引用
@article{arxiv.2604.21036,
title = {Who Defines Fairness? Target-Based Prompting for Demographic Representation in Generative Models},
author = {Marzia Binta Nizam and James Davis},
journal= {arXiv preprint arXiv:2604.21036},
year = {2026}
}