中文

大语言模型中显性与隐性偏见的全面研究

机器学习 2025-11-19 v1 计算机与社会

摘要

大语言模型(LLMs)继承了其训练数据集中的显性和隐性偏见。识别和缓解LLMs中的偏见对于确保公平输出至关重要,因为它们可能延续有害偏见和错误信息。本研究强调在生成式AI日益增长的背景下,需针对LLMs中的偏见进行处理。我们使用StereoSet和CrowSPairs等偏见特定基准测试,评估了多个生成模型(如BERT和GPT 3.5)中各种偏见的存在情况。我们提出了一种自动化的偏见识别框架,用于识别LLMs中各种社会偏见,如性别、种族、职业和宗教。我们采用双管齐下的方法来检测文本数据中的显性和隐性偏见。结果表明,微调后的模型在处理性别偏见方面存在困难,但在识别和避免种族偏见方面表现出色。我们的发现表明,尽管取得了一些成功,LLMs往往过度依赖关键词。为了阐明所分析LLMs在检测隐性偏见方面的能力,我们采用词袋分析方法,揭示了词汇中潜在偏见的迹象。为提升模型性能,我们应用了包括微调模型使用提示技术和偏见基准数据增强在内的增强策略。经微调的模型在跨数据集测试中展现出良好的适应性,并在隐性偏见基准测试中显著提升了性能,性能提升最高可达20%。

关键词

引用

@article{arxiv.2511.14153,
  title  = {A Comprehensive Study of Implicit and Explicit Biases in Large Language Models},
  author = {Fatima Kazi and Alex Young and Yash Inani and Setareh Rafatirad},
  journal= {arXiv preprint arXiv:2511.14153},
  year   = {2025}
}