跨语言语言模型中对政治人物的性别偏见量化
计算与语言
2023-11-10 v2 机器学习
摘要
近期研究已表明大型预训练语言模型反映了自然语言中表达的社会偏见。本文提出一种探测语言模型的简单方法,以开展针对政治人物的性别偏见多语言研究。我们将语言模型在政治人物姓名周围生成的形容词与动词的使用情况作为其性别的函数进行量化。为此,我们整理了一个含全球 25 万政治人物(包括其姓名与性别)的数据集。我们的研究在七种语言、六种不同语言建模架构上进行。结果表明,预训练语言模型对政治人物的立场在分析的语言间差异显著。我们发现,虽然如 dead(已故)、designated(指定的)等词与男女政治人物均相关,但少数特定词如 beautiful(美丽的)、divorced(离婚的)主要关联女性政治人物。最后,与先前发现相反,我们的研究表明较大的语言模型并不比小型模型显著更具性别偏见。
引用
@article{arxiv.2104.07505,
title = {Quantifying Gender Bias Towards Politicians in Cross-Lingual Language Models},
author = {Karolina Stańczak and Sagnik Ray Choudhury and Tiago Pimentel and Ryan Cotterell and Isabelle Augenstein},
journal= {arXiv preprint arXiv:2104.07505},
year = {2023}
}