差分隐私学习需要更好的模型初始化和自蒸馏
机器学习
2024-10-24 v1 人工智能
计算与语言
密码学与安全
摘要
差分隐私 SGD (DPSGD) 能够实现语言模型的隐私保护训练,但通常会降低效用、多样性和语言质量。我们引入了 DPRefine,一种三阶段方法:使用来自小型预训练 LM 的数据合成并经过严格过滤来初始化模型,在私有数据上应用 DP 微调,并执行自蒸馏以优化输出。该方法显著优于 vanilla DPSGD,AlpacaEval 在 78.4% 的案例中偏好 DPRefine 的生成结果。我们的分析表明,DPRefine 将生成文本中的语言错误减少了 84.0%,减轻了通常与 DPSGD 相关的语法和拼写错误。它还减少了非私有模型的不一致性,例如幻觉细节和错误归因的引用。我们发现像 GPT-2 这样的小型模型可以有效地用于初始化和蒸馏,突显了它们在实现可扩展和高效部署隐私保护语言方面的潜力。
引用
@article{arxiv.2410.17566,
title = {Differentially Private Learning Needs Better Model Initialization and Self-Distillation},
author = {Ivoline C. Ngong and Joseph P. Near and Niloofar Mireshghallah},
journal= {arXiv preprint arXiv:2410.17566},
year = {2024}
}
备注
18 pages