西斯拉夫语言模型中性别偏见的度量
计算与语言
2023-05-26 v3
摘要
已知预训练语言模型会将底层数据集中的偏见延续至下游任务。然而,这些发现主要基于英语单语语言模型,针对英语以外语言模型中编码偏见的调查研究甚少。本文通过分析西斯拉夫语言模型中的性别偏见填补了这一空白。我们引入了首个用于度量对男性、女性和非二元主语性别偏见的捷克语、波兰语和斯洛伐克语基于模板的数据集。我们使用单语与多语语言模型补全句子,并评估其对掩码语言建模目标的适用性。接着,我们通过量化生成词的毒性和性别特征,度量西斯拉夫语言模型中编码的性别偏见。我们发现这些语言模型会产生依赖于主语性别的伤害性补全。或许令人意外的是,捷克语、斯洛伐克语和波兰语语言模型以男性为主语时产生更多伤害性补全,经检视我们发现这是由于补全内容涉及暴力、死亡与疾病。
引用
@article{arxiv.2304.05783,
title = {Measuring Gender Bias in West Slavic Language Models},
author = {Sandra Martinková and Karolina Stańczak and Isabelle Augenstein},
journal= {arXiv preprint arXiv:2304.05783},
year = {2023}
}