衡量大型语言模型中的刻板印象与偏差
计算与语言
2026-05-20 v3
摘要
大型语言模型(LLMs)在 diverse 领域得到广泛应用,引发对其局限性和潜在风险的关注。本研究探讨了大型语言模型可能表现出的两种偏差类型:刻板印象偏差和偏差偏差。刻板印象偏差指的是大型语言模型持续将特定特征与特定人口统计群体关联。偏差偏差反映的是从大型语言模型生成的内容中提取的人口统计分布与真实世界人口统计分布之间的差异。通过要求四个先进的大型语言模型生成个人轮廓,我们检验了每个人口统计群体与政治 affiliation、宗教和性取向等属性之间的关联。我们的实验结果表明,所有被考察的大型语言模型都表现出对多个群体的显著刻板印象偏差和偏差偏差。我们的发现揭示了当大型语言模型推断用户属性时发生的偏差,并阐明了大型语言模型生成输出的潜在危害。
引用
@article{arxiv.2508.06649,
title = {Measuring Stereotype and Deviation Biases in Large Language Models},
author = {Daniel Wang and Eli Brignac and Minjia Mao and Xiao Fang},
journal= {arXiv preprint arXiv:2508.06649},
year = {2026}
}