中文

多模态语言-图像 AI 中“美国人==白人”的偏见

计算机与社会 2022-07-05 v1 人工智能 计算与语言 计算机视觉与模式识别 机器学习

摘要

我们对三种最先进的语言-图像 AI 模型 CLIP、SLIP 与 BLIP 进行评估,以寻找社会与实验心理学中曾观察到的一种偏见证据:将美国身份等同于白人。使用来自芝加哥面孔数据库(CFD)中自我认同为亚裔、黑人、拉丁裔及白人个体的标准化图像所做的嵌入关联测试(EATs)显示,白人个体比亚裔、黑人或拉丁裔个体更常与内群体集体词汇相关联。在对社会心理学家所报告美国身份三个核心方面的评估中,单类别 EATs 显示白人个体图像更常与爱国主义及在美国出生相关联,但与社会心理学先前发现一致,白人个体被认为较不可能平等对待所有种族与背景的人。三项下游机器学习任务展示了将美国人与白人相关联的偏见。在使用 BLIP 的视觉问答任务中,97% 的白人个体被识别为美国人,而亚裔个体仅 3%。当被问及所描绘个体居住于何州时,模型对亚裔个体有 53% 的次数回答中国,而对白人个体则总是回答某个美国州。在图像描述任务中,BLIP 对亚裔个体提及种族的比例高达 36%,却从未对白人个体提及种族。最后,给定来自 CFD 的初始化图像与文本“一个美国人”,使用 CLIP 文本引导的合成图像生成器(VQGAN)令所有种族个体的肤色变浅(基于像素亮度,黑人群体变浅 35%)。结果表明,将美国身份等同于白人的偏见被语言-图像 AI 习得,并传播至此类模型的下游应用。

关键词

引用

@article{arxiv.2207.00691,
  title  = {American == White in Multimodal Language-and-Image AI},
  author = {Robert Wolfe and Aylin Caliskan},
  journal= {arXiv preprint arXiv:2207.00691},
  year   = {2022}
}

备注

Accepted to AI Ethics and Society 2022