基于Transformer模型的性别偏见检测:以BERT为例
计算与语言
2021-11-01 v1 机器学习
摘要
在本文中,我们提出了一种利用注意力图检测基于Transformer模型的性别偏见的新方法。我们 1) 通过比较不同性别与职业之间根据注意力分数的关联程度,给出一种直观的性别偏见判断方法;2) 通过修改注意力模块设计了一个性别偏见检测器;3) 将该性别偏见检测器插入模型的不同位置以呈现内部性别偏见流动;4) 通过扫描整个Wikipedia(一个BERT预训练数据集)得出一致的性别偏见结论。我们观察到:1) 注意力矩阵 Wq 和 Wk 引入的性别偏见远多于其他模块(包括嵌入层);2) 偏见程度在模型内部呈周期性变化(注意力矩阵 Q、K、V 以及注意力层的其余部分(包括全连接层、残差连接和层归一化模块)增强性别偏见,而平均注意力则降低偏见)。
引用
@article{arxiv.2110.15733,
title = {Detecting Gender Bias in Transformer-based Models: A Case Study on BERT},
author = {Bingbing Li and Hongwu Peng and Rajat Sainju and Junhuan Yang and Lei Yang and Yueying Liang and Weiwen Jiang and Binghui Wang and Hang Liu and Caiwen Ding},
journal= {arXiv preprint arXiv:2110.15733},
year = {2021}
}