视觉语义人工智能中的标记性偏差
计算机视觉与模式识别
2022-05-24 v1 人工智能
计算与语言
计算机与社会
机器学习
摘要
我们评估了最先进的多模态“视觉语义”模型 CLIP(“Contrastive Language Image Pretraining”,对比语言图像预训练)中与年龄、性别、种族或民族标记相关的偏差。在将图像标注为“一个人的照片”或选择表示种族或民族的标签之间,CLIP 对白人个体选择“人”标签的比例为 47.9%,而对黑人、东亚人、东南亚人、印度人、拉丁裔或西班牙裔个体的这一比例仅为 5.0% 或更低。该模型更倾向于将无标记的“人”标签排在表示性别的标签之前:男性个体为 26.7%,女性个体为 15.2%。年龄影响模型是否对个体进行标记:20 岁以下女性个体比男性个体更可能被标以性别标签,但更不可能被标以年龄标签;而 40 岁以上女性个体比男性个体更可能基于年龄被标记。我们还考察了每个社会群体的自我相似性(平均成对余弦相似度),其中较高的自我相似性表示 CLIP 对该社会群体共享特征(年龄、种族或性别)给予了更多关注。随着年龄增长,女性个体表示的自我相似性增加速率高于男性个体,且在“70 岁以上”年龄段差异最为显著。自我相似性最高的十个社会群体均为 10 岁以下或 70 岁以上的个体,其中六个为女性个体。当比较的群体为白人男性个体与黑人女性个体时,男女社会群体间既有的自我相似性与标记性偏差进一步加剧。结果表明,CLIP 反映了产生其训练数据的语言与社会中的偏差。
引用
@article{arxiv.2205.11378,
title = {Markedness in Visual Semantic AI},
author = {Robert Wolfe and Aylin Caliskan},
journal= {arXiv preprint arXiv:2205.11378},
year = {2022}
}
备注
To be published at ACM FAccT 2022