SAGED:一种面向语言模型的整体偏见基准测试流程,具备可定制的公平性校准
计算与语言
2025-01-31 v7
摘要
开发无偏见的语言模型被广泛认为是至关重要的,然而现有的基准测试由于范围有限、数据污染以及缺乏公平性基线,在检测偏见方面存在不足。SAGED(bias) 是首个解决这些问题的整体基准测试流程。该流程包含五个核心阶段:抓取材料、组装基准、生成响应、提取数值特征以及使用差异指标进行诊断。SAGED 包括最大差异指标(如影响比)和偏见集中度指标(如最大 Z 分数)。注意到指标工具偏差和提示中的上下文偏差可能会扭曲评估,SAGED 实现了反事实分支和基线校准以进行缓解。为了演示,我们在 G20 国家上使用流行的 8b 级别模型(包括 Gemma2、Llama3.1、Mistral 和 Qwen2)应用了 SAGED。通过情感分析,我们发现虽然 Mistral 和 Qwen2 显示出比 Gemma2 和 Llama3.1 更低的最大差异和更高的偏见集中度,但所有模型都对俄罗斯和(除 Qwen2 外)中国等国家表现出明显的偏见。通过进一步的实验让模型扮演美国总统,我们看到偏见在异质方向上放大和转移。此外,我们看到 Qwen2 和 Mistral 没有参与角色扮演,而 Llama3.1 和 Gemma2 扮演特朗普的强度明显高于拜登和哈里斯,这表明这些模型中存在角色扮演性能偏差。
引用
@article{arxiv.2409.11149,
title = {SAGED: A Holistic Bias-Benchmarking Pipeline for Language Models with Customisable Fairness Calibration},
author = {Xin Guan and Ze Wang and Nathaniel Demchak and Saloni Gupta and Ediz Ertekin and Adriano Koshiyama and Emre Kazim and Zekun Wu},
journal= {arXiv preprint arXiv:2409.11149},
year = {2025}
}
备注
COLING 2025 Main Conference Oral Presentation