大语言模型中的偏见:起源、评估与缓解
计算与语言
2026-05-04 v2 机器学习
摘要
大语言模型(LLMs)已彻底改变了自然语言处理,但它们对偏见的敏感性带来了重大挑战。这篇综合综述审视了 LLMs 中偏见的全貌,从其起源到当前的缓解策略。我们将偏见分为内在偏见和外在偏见,分析了它们在各种 NLP 任务中的表现。该综述批判性地评估了一系列偏见评估方法,包括数据层面、模型层面和输出层面的方法,为研究人员提供了一个强大的偏见检测工具包。我们进一步探讨了缓解策略,将其分为模型前、模型中和模型后技术,并强调了它们的有效性和局限性。讨论了有偏见的 LLM 的伦理和法律影响,强调了在医疗保健和刑事司法等现实世界应用中可能造成的危害。通过综合当前关于 LLM 中偏见的知识,本综述为开发公平和负责任的人工智能系统的持续努力做出了贡献。我们的工作为致力于理解、评估和缓解 LLM 偏见的研究人员和从业者提供了一个全面的资源,促进了更公平的 AI 技术的发展。
引用
@article{arxiv.2411.10915,
title = {Bias in Large Language Models: Origin, Evaluation, and Mitigation},
author = {Yufei Guo and Muzhe Guo and Juntao Su and Zhou Yang and Mengqiu Zhu and Hongfei Li and Mengyang Qiu and Shuo Shuo Liu},
journal= {arXiv preprint arXiv:2411.10915},
year = {2026}
}