深度揭示LLM中表征偏见:针对种姓与宗教的案例研究
计算与语言
2025-08-07 v1
摘要
大型语言模型(LLM)中的表征偏见主要通过单次交互式测量,且聚焦于种族和性别等全球北方主义身份。我们扩展此研究,通过对GPT-4 Turbo进行系统性审计,揭示表征偏见的深度及其如何延伸至身份的较不探索维度。我们引导GPT-4 Turbo生成超过7,200个关于印度重要生活事件(如婚礼)的故事,使用旨在鼓励多样性的提示。将输出中宗教和种姓表征的多样性与印度实际人口分布(按统计数据)进行比较,量化LLM中宗教和种姓表征偏见的存在及其“黏性”。我们发现,GPT-4响应持续地过度代表文化主导群体,超出其统计比例,尽管旨在鼓励表征多样性的提示效果有限。我们的发现还表明,LLM中的表征偏见具有赢家全拿特征,偏向性可能超过其训练数据中的分布偏差,重复的基于提示的引导对解除这些偏见效果有限且不一致。这表明仅靠增加训练数据可能不足以纠正LLM偏见,需更根本性地改变模型开发方式。数据集与词表:https://github.com/agrimaseth/How-Deep-Is-Representational-Bias-in-LLMs
引用
@article{arxiv.2508.03712,
title = {How Deep Is Representational Bias in LLMs? The Cases of Caste and Religion},
author = {Agrima Seth and Monojit Choudhary and Sunayana Sitaram and Kentaro Toyama and Aditya Vashistha and Kalika Bali},
journal= {arXiv preprint arXiv:2508.03712},
year = {2025}
}
备注
Accepted to AIES 2025