中文

预训练语言模型去偏技术有效性的实证调研

计算与语言 2022-04-05 v3 机器学习

摘要

近期工作表明预训练语言模型从其训练的大量文本中捕获了社会偏见。这引起了人们对开发缓解此类偏见技术的关注。本工作中,我们对五种近期提出的偏见缓解技术进行实证调研:反事实数据增强(CDA)、Dropout、迭代零空间投影、Self-Debias和SentenceDebias。我们使用三个内在偏见基准量化每种技术的有效性,同时衡量这些技术对模型语言建模能力及其在下游NLU任务上表现的影响。我们通过实验发现:(1) Self-Debias是最强的去偏技术,在所有偏见基准上均获得改进分数;(2) 当前去偏技术在缓解非性别偏见时表现较不一致;以及 (3) 使用去偏策略在StereoSet和CrowS-Pairs等偏见基准上的改进常伴随语言建模能力的下降,难以判定偏见缓解是否真正有效。

关键词

引用

@article{arxiv.2110.08527,
  title  = {An Empirical Survey of the Effectiveness of Debiasing Techniques for Pre-trained Language Models},
  author = {Nicholas Meade and Elinor Poole-Dayan and Siva Reddy},
  journal= {arXiv preprint arXiv:2110.08527},
  year   = {2022}
}

备注

ACL 2022