大语言模型中的偏见与公平性:综述
计算与语言
2024-07-16 v3 人工智能
计算机与社会
机器学习
摘要
大语言模型 (LLMs) 的快速发展使得处理、理解和生成类人文本成为可能,并日益融入触及我们社会领域的系统。尽管取得了成功,这些模型仍可能学习、延续并放大有害的社会偏见。在本文中,我们提出了关于 LLM 偏见评估与缓解技术的全面综述。我们首先整合并形式化及扩展自然语言处理中社会偏见与公平性的概念,定义不同的危害层面,并引入若干将 LLM 公平性操作化的期望属性。然后我们通过提出三个直观的分类体系来统一文献:两个用于偏见评估,即指标与数据集,一个用于缓解。我们第一个偏见评估指标分类体系厘清了指标与评估数据集之间的关系,并按其在模型中作用的不同层次(嵌入、概率和生成文本)组织指标。我们第二个偏见评估数据集分类体系按数据集结构将其分为反事实输入或提示,并识别所针对的危害和社会群体;我们还发布了一个公开可用数据集的整合以便更好获取。我们第三个偏见缓解技术分类体系按其在预处理、训练中、训练内处理和后处理期间的干预对方法分类,并用阐明研究趋势的细分子类。最后,我们确定了未来工作的开放问题与挑战。通过综合广泛的最新研究,我们旨在提供现有文献的清晰指南,使研究者和从业者能更好地理解和防止 LLM 中偏见的传播。
引用
@article{arxiv.2309.00770,
title = {Bias and Fairness in Large Language Models: A Survey},
author = {Isabel O. Gallegos and Ryan A. Rossi and Joe Barrow and Md Mehrab Tanjim and Sungchul Kim and Franck Dernoncourt and Tong Yu and Ruiyi Zhang and Nesreen K. Ahmed},
journal= {arXiv preprint arXiv:2309.00770},
year = {2024}
}
备注
Accepted at Computational Linguistics, Volume 50, Number 3