在语言模型微调中消除差分隐私带来的偏差放大
机器学习
2024-02-08 v1 密码学与安全
计算机与社会
统计方法学
摘要
公平性和隐私性是机器学习(ML)从业者通常试图在模型中实现操作化的两个重要价值观。公平性旨在降低模型对社会/人口亚群的偏差。另一方面,通过差分隐私(DP)机制实现的隐私性限制了任何个体的训练数据对最终模型的影响。可信机器学习在隐私和公平性目标之间的权衡,对希望同时兼顾两者的人构成了挑战。我们表明,在微调大型语言模型(LLM)时,DP会放大性别、种族和宗教偏见,产生的模型比不使用DP微调的模型更具偏见。我们发现这种放大效应的原因是各亚群之间梯度收敛的不一致性。通过二元性别偏差的案例,我们证明了反事实数据增强(CDA)作为一种已知的处理偏差的方法,也能缓解由DP引起的偏差放大。因此,DP和CDA可以结合使用,在保持公平性和隐私性的同时微调模型。
引用
@article{arxiv.2402.04489,
title = {De-amplifying Bias from Differential Privacy in Language Model Fine-tuning},
author = {Sanjari Srivastava and Piotr Mardziel and Zhikhun Zhang and Archana Ahlawat and Anupam Datta and John C Mitchell},
journal= {arXiv preprint arXiv:2402.04489},
year = {2024}
}