FairSISA:提升 LLM 遗忘公平性的集成后处理方法
机器学习
2023-12-13 v1 计算机与社会
摘要
训练大型语言模型(LLM)在时间和计算资源方面是一项成本高昂的工作。在无监督预训练阶段使用的大量训练数据使得验证所有数据变得困难,不幸的是,训练过程中可能会吸收不良数据。从头开始重新训练是不切实际的,这催生了“机器遗忘”学科,在该学科中,通过修改模型使其“遗忘”不良信息而无需重新训练。然而,任何修改都可能改变 LLM 的行为,尤其是在公平性等关键维度上。这是第一项针对 LLM 探讨遗忘与公平性之间相互作用的工作。具体而言,我们关注一种名为 SISA [Bourtoule et al., 2021] 的流行遗忘框架,该框架创建了一个在不相交分片上训练的模型集成。我们评估了 SISA 在性能与公平性之间的权衡,并实证表明 SISA 确实会降低 LLM 的公平性。为了弥补这一点,我们针对 SISA 生成的集成模型提出了后处理偏差缓解技术。我们改编了 [Hardt et al., 2016] 中的后处理公平性提升技术,设计了三种能够处理模型集成的方法,并证明了其中一种方法是针对模型集成的最优公平预测器。通过实验结果,我们展示了我们提出的名为“FairSISA”的后处理框架的有效性。
引用
@article{arxiv.2312.07420,
title = {FairSISA: Ensemble Post-Processing to Improve Fairness of Unlearning in LLMs},
author = {Swanand Ravindra Kadhe and Anisa Halimi and Ambrish Rawat and Nathalie Baracaldo},
journal= {arXiv preprint arXiv:2312.07420},
year = {2023}
}
备注
Accepted in NeurIPS 2023 Workshop on Socially Responsible Language Modelling Research (SoLaR)