BEATS:用于大型语言模型的偏见评估与测试套件
计算与语言
2025-04-01 v1 人工智能
摘要
在本研究中,我们提出了 BEATS,一种用于评估大型语言模型(LLM)中偏见、伦理、公平性与事实性的新框架。基于 BEATS 框架,我们提出了一个针对 LLM 的偏见基准测试,用于衡量 29 个不同指标上的表现。这些指标涵盖了广泛的特征,包括人口统计学、认知和社会偏见,以及伦理推理、群体公平性和与事实性相关的错误信息风险。这些指标能够定量评估 LLM 生成的响应在多大程度上可能延续社会偏见,从而强化或扩大系统性不平等。要在该基准测试中获得高分,LLM 必须在其响应中表现出非常公平的行为,这使其成为负责任 AI 评估的严格标准。基于我们实验数据的经验结果表明,行业领先模型生成的输出中有 37.65% 包含某种形式的偏见,突显了在关键决策系统中使用这些模型的重大风险。BEATS 框架与基准测试提供了一种可扩展且统计严谨的方法,用于对 LLM 进行基准测试、诊断驱动偏见的因素以及制定缓解策略。通过 BEATS 框架,我们的目标是帮助开发更具社会责任感和伦理契合的 AI 模型。
引用
@article{arxiv.2503.24310,
title = {BEATS: Bias Evaluation and Assessment Test Suite for Large Language Models},
author = {Alok Abhishek and Lisa Erickson and Tushar Bandopadhyay},
journal= {arXiv preprint arXiv:2503.24310},
year = {2025}
}
备注
32 pages, 33 figures, preprint version