DECASTE:通过多维偏见分析揭示大语言模型中的种姓偏见
计算与语言
2025-06-06 v2 计算机与社会
摘要
近期大型语言模型(LLM)的进展彻底改变了自然语言处理(NLP)并将其应用扩展到 diverse 领域。然而,尽管这些模型拥有惊人的能力,但被证明会反映并延续有害的社会偏见,包括基于种族、性别和宗教的偏见。一个关键且充实探索的问题是对种姓偏见的强化,特别是针对印度被边缘化的种姓群体,如Dalits和Shudras。本文通过提出DECASTE,一种 novel 的、多维框架,用于检测和评估LLM中隐式和显式种姓偏见来解决这一差距。我们的 方法在四个维度上评估种姓公平性:社会文化、经济、教育和政治,使用一系列定制的提示策略。通过对多种最先进的LLM进行基准测试,我们发现这些模型系统性地强化了种姓偏见,观察到针对被压迫者与主导种姓群体的处理存在显著差异。例如,当比较Dalits和Shudras与主导种姓群体时,偏见得分显著 elevated,反映出持续存在于模型输出中的社会偏见。这些结果暴露了LLM中隐性而普遍的种姓偏见,强调需要更全面和包容性的偏见评估方法,以评估在实际情境中部署此类模型的潜在风险。
引用
@article{arxiv.2505.14971,
title = {DECASTE: Unveiling Caste Stereotypes in Large Language Models through Multi-Dimensional Bias Analysis},
author = {Prashanth Vijayaraghavan and Soroush Vosoughi and Lamogha Chiazor and Raya Horesh and Rogerio Abreu de Paula and Ehsan Degan and Vandana Mukherjee},
journal= {arXiv preprint arXiv:2505.14971},
year = {2025}
}
备注
7 (content pages) + 2 (reference pages) + 5 (Appendix pages), 5 figures, 6 Tables, IJCAI 2025