公平大语言模型的不可能性
计算与语言
2025-06-06 v2 人机交互
机器学习
应用统计
机器学习
摘要
通用人工智能系统,特别是大语言模型的兴起,引发了关于如何大规模减少偏见和确保公平的紧迫道德问题。研究人员已经记录了大语言模型提示和响应中人口统计特征(例如种族、性别)之间的显著相关性所体现的一种“偏见”,但尚不清楚如何用更严格的定义(如群体公平或公平表示)来评估大语言模型的公平性。我们分析了各种技术性公平框架,并发现每个框架都存在固有挑战,使得开发公平的大语言模型变得棘手。我们表明,每个框架要么在逻辑上无法扩展到通用人工智能的语境,要么在实践中不可行,这主要是由于大量非结构化训练数据以及人类群体、用例和敏感属性的众多潜在组合。即使经验性挑战(如有限的参与性输入和有限的测量方法)被克服,这些固有挑战对于包括大语言模型在内的通用人工智能仍将持续存在。尽管如此,公平仍将是一种重要的模型评估类型,并且仍有有前景的研究方向,特别是制定大语言模型开发者责任标准、特定语境评估,以及能够将公平性扩展到现代人机交互多样化语境中的迭代式、参与式和人工智能辅助式评估方法。
引用
@article{arxiv.2406.03198,
title = {The Impossibility of Fair LLMs},
author = {Jacy Anthis and Kristian Lum and Michael Ekstrand and Avi Feller and Chenhao Tan},
journal= {arXiv preprint arXiv:2406.03198},
year = {2025}
}
备注
Published in ACL 2025