Indian-BhED:一个用于度量大语言模型中印度中心偏见的数据集
计算与语言
2024-08-12 v2 计算机与社会
摘要
大语言模型(LLMs)如今每日被数百万人使用,其可能编码社会偏见,使用户面临代表性伤害。关于 LLM 偏见的学术文献体量庞大,但主要采用西方中心框架,相对较少关注全球南方的偏见程度与潜在危害。在本文中,我们通过 Indian-BhED(一种首创的数据集,包含印度种姓与宗教刻板印象背景下的刻板与非刻板示例)依据印度中心框架量化流行 LLM 中的刻板偏见。我们发现,受测的大多数 LLM 在印度语境下强烈倾向于输出刻板印象,尤其与传统西方语境中研究的性别与种族等偏见维度相比。值得注意的是,我们发现 GPT-2、GPT-2 Large 和 GPT 3.5 在种姓(63–79%)和宗教(69–72%)维度上,作为所有句子百分比,尤其倾向于偏好刻板输出。我们最后探究了 LLM 中此类有害行为的潜在原因,并提出了减少刻板与非刻板偏见的干预技术。本工作的发现凸显了在 AI 公平性与 LLM 评估研究中纳入更多元声音的必要性。
引用
@article{arxiv.2309.08573,
title = {Indian-BhED: A Dataset for Measuring India-Centric Biases in Large Language Models},
author = {Khyati Khandelwal and Manuel Tonneau and Andrew M. Bean and Hannah Rose Kirk and Scott A. Hale},
journal= {arXiv preprint arXiv:2309.08573},
year = {2024}
}
备注
To be published in GoodIT '24, doi:10.1145/3677525.3678666. 14 pages