用于降低预训练模型中隐性性别偏见的对抗样本生成
计算与语言
2021-10-05 v1
摘要
过去几年中,诸如 BERT、GPT 等上下文预训练神经语言模型在各种 NLP 任务中展现出显著增益。为增强现有预训练模型的鲁棒性,一种途径是生成和评估对抗样本以进行数据增强或对抗学习。同时,模型中嵌入的性别偏见在实际应用中似乎是一个严重问题。许多研究已涵盖词级信息(例如性别刻板职业)产生的性别偏见,但极少有研究者调查句子级和隐性情况。在本文中,我们提出了一种在句子级自动生成隐性性别偏见样本的方法以及一种衡量性别偏见的度量。我们方法生成的样本将根据准确率进行评估。该度量将用于指导从预训练模型生成样本。因此,这些样本可用于对预训练模型发起攻击。最后,我们讨论了所生成样本在降低性别偏见方面用于未来研究的评估效力。
引用
@article{arxiv.2110.01094,
title = {Adversarial Examples Generation for Reducing Implicit Gender Bias in Pre-trained Models},
author = {Wenqian Ye and Fei Xu and Yaojia Huang and Cassie Huang and Ji A},
journal= {arXiv preprint arXiv:2110.01094},
year = {2021}
}