通用短语去偏器:在多词元层面对掩码语言模型去偏
计算与语言
2024-01-26 v3 人工智能
摘要
预训练语言模型所暴露的社会偏见和不受欢迎的刻板印象正成为其应用的障碍。与众多针对词级别的去偏方法相比,对短语级别偏见的关注相对较少,限制了去偏在学科领域中的表现。本文提出一种称为通用短语去偏器(General Phrase Debiaser)的自动多词元去偏流程,能够缓解掩码语言模型中的短语级偏见。具体而言,我们的方法包含一个从维基百科页面生成刻板短语的短语过滤阶段,以及一个能在多词元层面对模型去偏以应对短语偏见挑战的模型去偏阶段。后者搜索触发模型偏见的提示,并将其用于去偏。在标准数据集和指标上的最优结果表明,我们的方法能在不同参数规模的模型上显著减少职业与多个学科上的性别偏见。
引用
@article{arxiv.2311.13892,
title = {General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level},
author = {Bingkang Shi and Xiaodan Zhang and Dehan Kong and Yulei Wu and Zongzhen Liu and Honglei Lyu and Longtao Huang},
journal= {arXiv preprint arXiv:2311.13892},
year = {2024}
}
备注
Accepted by ICASSP 2024 as mian conference paper