GPTBIAS:一个用于评估大语言模型偏见的综合框架
计算与语言
2023-12-12 v1 计算机与社会
机器学习
摘要
警告:本文包含可能令人反感或不适的内容。大语言模型(LLMs)在各种应用中的使用显著增加,既有其原始形式,也有经过微调的适配形式。因此,LLMs 已获得普及并被庞大的用户社区广泛采用。然而,对 LLMs 的一个担忧是其可能生成带有社会偏见的内容。现有的评估方法存在诸多限制,且其结果的可解释性程度有限。在本工作中,我们提出了一个名为 GPTBIAS 的偏见评估框架,该框架利用 LLMs(例如 GPT-4)的高性能来评估模型中的偏见。我们还引入了专门为评估模型偏见而设计的提示,称为偏见攻击指令。为了增强偏见评估的可信度和可解释性,我们的框架不仅提供偏见分数,还提供详细信息,包括偏见类型、受影响的人群、关键词、偏见背后的原因以及改进建议。我们进行了广泛的实验,以证明我们偏见评估框架的有效性和可用性。
引用
@article{arxiv.2312.06315,
title = {GPTBIAS: A Comprehensive Framework for Evaluating Bias in Large Language Models},
author = {Jiaxu Zhao and Meng Fang and Shirui Pan and Wenpeng Yin and Mykola Pechenizkiy},
journal= {arXiv preprint arXiv:2312.06315},
year = {2023}
}