在显式无偏见的大型语言模型中测量隐性偏见
计算机与社会
2024-05-24 v2 计算与语言
摘要
大型语言模型 (LLMs) 能够通过显式的社会偏见测试,但仍然存在隐性偏见,类似于那些认同平等主义信仰却表现出微妙偏见的人类。测量此类隐性偏见可能是一项挑战:随着 LLMs 变得日益专有化,可能无法访问其嵌入并应用现有的偏见测量方法;此外,如果隐性偏见影响这些系统做出的实际决策,它们才主要构成关注点。我们通过引入两种新的偏见测量方法来解决这两个挑战:LLM Implicit Bias,一种基于提示的揭示隐性偏见的方法;以及 LLM Decision Bias,一种在决策任务中检测微妙歧视的策略。这两种测量方法均基于心理学研究:LLM Implicit Bias 改编了内隐联想测验,该测验广泛用于研究人类大脑中概念之间的自动联想;而 LLM Decision Bias 将心理学研究结果操作化,表明对两名候选人之间的相对评估(而非独立评估每个人的绝对评估)更能诊断隐性偏见。使用这些测量方法,我们在 4 个社会类别(种族、性别、宗教、健康)的 21 种刻板印象(如种族与犯罪、种族与武器、性别与科学、年龄与消极性)中,在 8 个价值对齐模型中发现了反映社会中普遍存在的刻板印象偏见。我们基于提示的 LLM Implicit Bias 测量与现有的基于语言模型嵌入的偏见方法相关,但能更好地预测由 LLM Decision Bias 测量的下游行为。这些新的基于提示的测量方法借鉴了心理学长期以来基于纯粹可观察行为测量刻板印象偏见的研究历史;它们揭示了专有的价值对齐 LLMs 中根据标准基准看似无偏见的微妙偏见。
引用
@article{arxiv.2402.04105,
title = {Measuring Implicit Bias in Explicitly Unbiased Large Language Models},
author = {Xuechunzi Bai and Angelina Wang and Ilia Sucholutsky and Thomas L. Griffiths},
journal= {arXiv preprint arXiv:2402.04105},
year = {2024}
}