大语言模型和文本到图像模型中的成人化偏见
计算机与社会
2025-06-10 v1
摘要
生成式 AI 模型在教育、警务和社交媒体等领域的快速采用引发了关于潜在偏见和安全问题的重大担忧,特别是在受保护属性(如种族和性别)上,以及与未成年人互动时。鉴于促进与 AI 系统安全交互的紧迫性,我们研究了年轻女孩在种族和性别轴线上的偏见。更具体地说,我们关注"成人化偏见",即黑人女孩被认为比白人同龄人更具反抗性、更具性暗示和更有罪责性。对齐技术的进步显示出在减轻偏见方面有希望,但它们在模型和偏见类型上的覆盖范围和有效性各不相同。因此,我们测量了广泛使用的大语言模型(LLMs)和文本到图像(T2I)模型(如 OpenAI、Meta 和 Stability AI 模型)中显性和隐性的成人化偏见。我们发现 LLMs 对黑人女孩表现出显性和隐性的成人化偏见,与白人同龄人相比,给她们分配了更严厉、更性化的后果。此外,我们发现 T2I 模型将黑人女孩描绘得比白人同龄人更年长、穿着更暴露,说明成人化偏见跨越模态持续存在。我们做出了三项关键贡献:(1)我们在生成式 AI 模型中测量了一种新的偏见形式,(2)我们系统地跨模态研究了成人化偏见,(3)我们的发现强调当前的对齐方法不足以全面解决偏见。因此,需要新的对齐方法来解决成人化偏见等偏见,以确保 AI 的安全和公平部署。
引用
@article{arxiv.2506.07282,
title = {Adultification Bias in LLMs and Text-to-Image Models},
author = {Jane Castleman and Aleksandra Korolova},
journal= {arXiv preprint arXiv:2506.07282},
year = {2025}
}
备注
Accepted to the ACM Conference on Fairness, Accountability, and Transparency (FAccT '25)