基于AdapterFusion的参数高效模块化偏见缓解方法
计算与语言
2023-06-21 v2 人工智能
摘要
大型预训练语言模型包含社会偏见,并将这些偏见带入下游任务。当前的处理中偏见缓解方法(如对抗训练)通过更新模型参数来施加去偏, effectively将模型转移到一个新的、不可逆的去偏状态。在本工作中,我们提出一种新方法,开发独立于模型的 standalone 去偏功能,可按需集成到模型中,同时保持核心模型不变。借鉴多任务学习中 AdapterFusion 的概念,我们引入 DAM(使用适配器模块的去偏)——一种去偏方法,首先将任意偏见缓解功能封装到独立的适配器中,然后按需将其加入模型以赋予公平性特质。我们在三个分类任务上以性别、种族和年龄作为受保护属性进行了大量实验。结果表明,DAM 改善或保持了偏见缓解的有效性,在多属性场景中避免了灾难性遗忘,并维持了相当的任务性能,同时实现了参数高效性以及原始模型与去偏模型间的轻松切换。
引用
@article{arxiv.2302.06321,
title = {Parameter-efficient Modularised Bias Mitigation via AdapterFusion},
author = {Deepak Kumar and Oleg Lesota and George Zerveas and Daniel Cohen and Carsten Eickhoff and Markus Schedl and Navid Rekabsaz},
journal= {arXiv preprint arXiv:2302.06321},
year = {2023}
}
备注
Post EACL 2023 version