大语言模型中的偏见:批判性检视与缓解
计算与语言
2025-12-01 v1 计算机与社会
机器学习
摘要
大型语言模型(LLM)如 ChatGPT 近年来因自然语言处理(NLP)的进步而广受欢迎,其应用场景遍及多个学科和日常生活。LLM 继承了其训练数据集中显性和隐性偏见,这些偏见可能包括社会、伦理、文化、宗教等偏见和刻板印象。全面检视这些不足之处,识别偏见的存在与程度,识别其来源,并尝试缓解这些有偏见的输出,以确保公平输出,减少有害刻板印象和误导信息。本研究检视并凸显了在人工智能生成式技术日益增长的背景下,如何解决 LLM 中的偏见的必要性。我们利用刻板检验基准如 StereoSet 和 CrowSPairs 来评估许多不同生成模型(如 BERT、GPT 3.5 和 ADA)中各种偏见的存在。为检测显性和隐性偏见,我们采用三管齐下的全面且包容性分析方法。结果表明,微调后的模型在处理性别偏见方面存在困难,但在识别和避免种族偏见方面表现出色。我们的发现还表明,尽管在某些情况下取得了成功,LLM 往往过度依赖提示中的关键词,其输出也往往如此。这表明 LLM 缺乏对其输出准确性和真实性进行深入理解的能力。最后,在提升模型性能方面,我们应用了包括微调、不同提示技术以及偏见基准数据增强的增强学习策略。我们发现,微调后的模型在跨数据集测试中展现出有前景的适应性,在隐性偏见基准测试中实现了显著提升,性能提升幅度可达高达 20%。
引用
@article{arxiv.2511.21711,
title = {Addressing Stereotypes in Large Language Models: A Critical Examination and Mitigation},
author = {Fatima Kazi},
journal= {arXiv preprint arXiv:2511.21711},
year = {2025}
}