中文

偏见中性化框架:基于偏见智商(BiQ)衡量大语言模型的公平性

计算与语言 2024-04-30 v1 人工智能

摘要

大语言模型(LLM)在塑造公共话语和决策方面的影响日益增长,进而凸显了必须解决这些 AI 系统内在偏见的紧迫性。在 AI 广泛融入各行业后,针对大语言模型中的种族偏见的应对从未如此重要。本文引入一种新框架,称为全面偏见中性化框架(Comprehensive Bias Neutralization Framework, CBNF),其代表了一种创新的方法,用于量化和缓解大语言模型中的偏见。我们的框架将大语言模型偏见指数(LLMBI)[Oketunji 等,2023] 和无人口统计学偏见消除(BLIND)[Orgad 与 Belinkov,2023] 方法论结合在一起,创建了一个新的指标,称为偏见智商(Bias Intelligence Quotient, BiQ),用于在不依赖人口统计学标注的情况下检测、衡量和缓解大语言模型中的种族偏见。通过引入增强 LLMBI 的额外公平性指标的 BiQ,CBNF 提供了一种多维度的偏见评估指标,强调在 AI 中实现公平性需要一种细致入微的方法 [Mehrabi 等,2021]。本文对 Latimer AI(一个逐步在黑人历史和文化方面进行训练的语言模型)与 ChatGPT 3.5 进行详细分析,说明 Latimer AI 通过针对性训练和精炼的偏见缓解策略在检测种族、文化和性别偏见方面的有效性 [Latimer 与 Bender,2023]。

关键词

引用

@article{arxiv.2404.18276,
  title  = {Bias Neutralization Framework: Measuring Fairness in Large Language Models with Bias Intelligence Quotient (BiQ)},
  author = {Malur Narayan and John Pasmore and Elton Sampaio and Vijay Raghavan and Gabriella Waters},
  journal= {arXiv preprint arXiv:2404.18276},
  year   = {2024}
}

备注

41 pages