COBIAS:评估语言模型偏见基准的上下文可靠性
计算与语言
2025-05-19 v4 人工智能
摘要
大型语言模型通常继承自其训练所用的网络数据中的偏见,这些数据包含刻板印象和偏见。当前评估和缓解这些偏见的方法依赖于偏见基准数据集。这些基准通过观察语言模型在偏见陈述上的行为来衡量偏见。然而,这些陈述缺乏对其试图呈现的情境的上下文考虑。为解决这一问题,我们引入了一个上下文可靠性框架,该框架通过考虑偏见陈述可能出现的各种上下文来评估模型对偏见陈述的鲁棒性。我们开发了面向上下文的偏见指标与评估分数(COBIAS),根据模型在不同上下文中的行为方差来衡量偏见陈述在检测偏见方面的可靠性。为了评估该指标,我们通过添加上下文信息,增强了来自两个现有基准数据集的2291条刻板印象陈述。我们表明,COBIAS与人类对偏见陈述上下文可靠性的判断一致(斯皮尔曼ρ = 0.65,p = 3.4 * 10^{-60}),并且可用于创建可靠的基准,这将有助于偏见缓解工作。
引用
@article{arxiv.2402.14889,
title = {COBIAS: Assessing the Contextual Reliability of Bias Benchmarks for Language Models},
author = {Priyanshul Govil and Hemang Jain and Vamshi Krishna Bonagiri and Aman Chadha and Ponnurangam Kumaraguru and Manas Gaur and Sanorita Dey},
journal= {arXiv preprint arXiv:2402.14889},
year = {2025}
}