通过预测质量代理衡量掩码语言模型中的社会偏见
计算与语言
2025-08-19 v3
摘要
Transformer 语言模型在各种自然语言任务中取得了 state-of-the-art 性能,但已被证明编码了不需要的偏见。我们利用提出的代理函数,在迭代掩码实验中评估使用掩码语言建模(masked language modeling, MLM)目标训练的 Transformer 所编码的社会偏见,以衡量 Transformer 模型的预测质量,并评估 MLM 对弱势群体和优势群体的偏好。我们发现所有模型都编码了令人担忧的社会偏见。我们将偏见估计与使用基准数据集的其他评估方法产生的结果进行比较,并评估其与人工标注偏见的一致性。我们通过评估在 MLM 目标下重新训练 MLM 后引入的社会偏见来扩展先前的工作,发现提出的度量标准能基于模型间对有偏见句子的相对偏好,产生更准确和敏感的偏见估计,而其他方法往往低估了针对弱势群体的有偏见句子重新训练后引入的偏见。
引用
@article{arxiv.2402.13954,
title = {Measuring Social Biases in Masked Language Models by Proxy of Prediction Quality},
author = {Rahul Zalkikar and Kanchan Chandra},
journal= {arXiv preprint arXiv:2402.13954},
year = {2025}
}