STOP!对大语言模型进行偏见敏感性测试基准测试
计算与语言
2025-02-04 v2 人工智能
计算机与社会
摘要
缓解大语言模型(LLMs)中的显性和隐性偏见已成为自然语言处理领域的关键焦点。然而,许多当前方法评估场景是孤立的,不考虑更广泛的上下文或每个情境中潜在偏见的谱系。为此,我们引入了敏感性测试在歧视性进展(STOP)数据集,包含450个歧视性进展,包含2700个不同严重程度的独特句子,依次从较不显性歧视到更显性歧视。STOP涵盖广泛的9个人口学领域和46个亚人口学领域,确保包容性和全面覆盖。我们评估了包括GPT-4、Mixtral和Llama 3在内的多个领先封闭和开源模型。我们的发现表明,即使是表现最好的模型在检测偏见方面也不一致,成功率范围在19.3%到69.8%之间。我们还展示了如何通过STOP与人类判断力对齐模型,可以在敏感任务如BBQ、StereoSet和CrowS-Pairs上提高答案率最高可达191%,同时保持或甚至提高性能。STOP为评估LLMs中偏见的复杂性质提供了新的框架,将促进更有效的偏见缓解策略,并促进更公平的语言模型的创建。
引用
@article{arxiv.2409.13843,
title = {STOP! Benchmarking Large Language Models with Sensitivity Testing on Offensive Progressions},
author = {Robert Morabito and Sangmitra Madhusudan and Tyler McDonald and Ali Emami},
journal= {arXiv preprint arXiv:2409.13843},
year = {2025}
}
备注
9 pages (excluding references), accepted to EMNLP 2024 Main Conference