交叉视角下语言模型偏见态度关联的评估
计算机与社会
2023-07-10 v1 人工智能
计算与语言
机器学习
摘要
语言模型在嵌入心理学中已有记载的隐性偏见的大规模语料库上训练。社会群体的效价关联(愉悦/不愉悦)决定了社会认知中针对群体和概念的偏见态度。基于这一既有文献,我们利用提供交叉语境的句子模板量化了英语语言模型中社会群体的效价。我们研究了与年龄、教育、性别、身高、智力、读写能力、种族、宗教、性、性取向、社会阶层和体重相关的偏见。我们提出了一种概念投影方法,通过语言模型的上下文词嵌入来捕获效价子空间。将基于投影的方法适配于量化偏见的嵌入关联测试,我们发现语言模型对语言中的性别身份、社会阶层和性取向信号表现出最强烈的偏见态度。我们发现所研究的最大且性能更好的模型也更具偏见,因为它有效捕获了社会文化数据中嵌入的偏见。我们通过在内在效价评估任务上的优异表现验证了偏见评估方法。该方法使我们能够度量复杂的交叉偏见,因为这些偏见已知会在延续历史偏见的语言模型输出与应用中显现。此外,我们的方法有助于设计公正,因为它研究了语言中代表性不足群体(如跨性别和同性恋个体)的关联。
引用
@article{arxiv.2307.03360,
title = {Evaluating Biased Attitude Associations of Language Models in an Intersectional Context},
author = {Shiva Omrani Sabbaghi and Robert Wolfe and Aylin Caliskan},
journal= {arXiv preprint arXiv:2307.03360},
year = {2023}
}
备注
to be published in AIES 2023