语言模型微调中偏差缓解效应的可迁移性研究
计算与语言
2021-04-13 v2 机器学习
摘要
微调后的语言模型已被证明在文本分类和共指消解等一系列建模任务中对受保护群体表现出偏差。以往工作聚焦于检测这些偏差、降低数据表示中的偏差,以及在微调期间使用辅助训练目标来缓解偏差。尽管这些技术对当前任务和领域实现了偏差削减,但偏差缓解的效果可能无法直接迁移到新任务,需要额外的数据收集和敏感属性的定制标注,以及重新评估适当的公平性指标。我们探索上游偏差缓解(UBM)在降低下游任务偏差上的可行性与益处,即先通过微调将偏差缓解应用于上游模型,随后将其用于下游微调。我们通过针对仇恨言论检测、毒性检测、职业预测和共指消解任务上多种偏差因素的广泛实验发现,UBM 的效应确实可通过微调迁移至新的下游任务或领域,相比直接在下游任务上微调或从原始上游模型迁移,能创建偏差更小的下游模型。尽管挑战犹存,我们表明 UBM 为 LM 微调中更高效且可及的偏差缓解提供了前景。
引用
@article{arxiv.2010.12864,
title = {On Transferability of Bias Mitigation Effects in Language Model Fine-Tuning},
author = {Xisen Jin and Francesco Barbieri and Brendan Kennedy and Aida Mostafazadeh Davani and Leonardo Neves and Xiang Ren},
journal= {arXiv preprint arXiv:2010.12864},
year = {2021}
}
备注
14 pages; Accepted at NAACL 2021