差分隐私是否影响预训练NLP模型中的偏差?
计算与语言
2024-10-25 v1 人工智能
机器学习
摘要
差分隐私(DP)在微调预训练大型语言模型(LLM)时被应用,以限制训练样本的泄露。虽然大多数DP研究专注于改善模型的隐私-效用权衡,但一些研究发现DP可能对受保护群体不公平或有偏见。在本工作中,我们通过实证分析展示了DP对LLM偏差的影响。差分隐私训练可能增加模型对受保护群体相对于AUC偏差指标的偏见。DP使得模型更难区分受保护群体与其余人口中其他群体的正负样本。我们的结果还表明,DP对偏差的影响不仅受隐私保护水平的影响,还受数据集本身分布的影响。
引用
@article{arxiv.2410.18749,
title = {Does Differential Privacy Impact Bias in Pretrained NLP Models?},
author = {Md. Khairul Islam and Andrew Wang and Tianhao Wang and Yangfeng Ji and Judy Fox and Jieyu Zhao},
journal= {arXiv preprint arXiv:2410.18749},
year = {2024}
}
备注
Github https://github.com/khairulislam/DP-on-NLP-Bias