中文

基于属性移除子网络的模块化按需偏见缓解方法

机器学习 2023-06-06 v5 计算与语言 计算机与社会

摘要

社会偏见反映于大型预训练语言模型及其在下游任务上微调的版本中。常见的处理中偏见缓解方法,如对抗训练和互信息移除,引入了额外的优化准则,并更新模型以达到新的去偏状态。然而在实践中,终端用户和从业者可能更倾向于切换回原始模型,或仅针对受保护属性的特定子集应用去偏。为实现这一点,我们提出一种新颖的模块化偏见缓解方法,由独立的高度稀疏去偏子网络组成,每个去偏模块可在推理时按需集成到核心模型中。我们的方法借鉴了 \emph{diff} 剪枝的概念,并提出了一种适用于多种表示解耦优化的新型训练机制。我们在以性别、种族和年龄为受保护属性的三个分类任务上进行了实验。结果表明,与基线微调相比,我们的模块化方法在保持任务性能的同时,改善(或至少持平)了偏见缓解的有效性。特别是在双属性数据集上,我们采用分别学习的去偏子网络的方法,展现了对任一或同时两个子网络进行选择性偏见缓解的有效利用。

关键词

引用

@article{arxiv.2205.15171,
  title  = {Modular and On-demand Bias Mitigation with Attribute-Removal Subnetworks},
  author = {Lukas Hauzenberger and Shahed Masoudian and Deepak Kumar and Markus Schedl and Navid Rekabsaz},
  journal= {arXiv preprint arXiv:2205.15171},
  year   = {2023}
}

备注

Accepted in Findings of ACL 2023