LLM的歧视:决策与总结中的跨语言偏见评估与缓解
计算与语言
2025-09-15 v1
摘要
大型语言模型(LLM)的快速融入various 领域引发了社会不平等和信息偏见的担忧。本研究探讨LLM与背景、性别、年龄相关的偏见,特别是其对决策和总结任务的影响。此外,研究考察了这些偏见在跨语言中的传播,并评估了提示指令缓解策略的有效性。我们采用改进版Tamkin等人(2023)的数据集翻译成荷兰语,为决策任务创建151,200个独特提示,为总结任务创建176,400个提示。在GPT-3.5和GPT-4o上测试了各种人口学变量、指令、显现水平和语言。我们的分析显示,两个模型在决策过程中都存在显著偏见,偏好female性别、较年轻的年龄以及某些背景如非裔美国人背景。在 contrast, 总结任务显示出最小的偏见证据,尽管GPT-3.5在英文中存在显著的年龄差异。跨语言分析显示,偏见模式在英文和荷兰语之间大致相似,但在特定人口学类别中观察到显著差异。新提出的缓解指令虽无法完全消除偏见,但在减少偏见方面显示出潜力。最有效的指令实现了27%的平均偏差减少。值得注意的是,与GPT-3.5不同,GPT-4o对所有英文提示都显示出减少的偏见,表明更新模型在特定缓解策略方面具有潜力。该研究凸显了谨慎采纳LLM和特定于情境的偏见测试的重要性,突显了持续开发有效缓解策略以确保AI负责任部署的必要性。
引用
@article{arxiv.2509.09735,
title = {Discrimination by LLMs: Cross-lingual Bias Assessment and Mitigation in Decision-Making and Summarisation},
author = {Willem Huijzer and Jieying Chen},
journal= {arXiv preprint arXiv:2509.09735},
year = {2025}
}
备注
7 pages