大型语言模型的差分隐私下一个标记预测
密码学与安全
2024-04-30 v3 计算与语言
机器学习
摘要
确保大型语言模型(LLM)的隐私变得越来越重要。实现这一目标最广泛采用的技术是DP-SGD,它训练模型以保证差分隐私(DP)。然而,DP-SGD高估了对手对模型进行白盒访问的能力,因此导致比SGD更长的训练时间和更大的内存使用。另一方面,商业LLM部署主要是基于云的;因此,对手对LLM的访问是黑盒的。受这些观察的启发,我们提出了私有混合集成分布(PMixED):一种用于下一个标记预测的私有预测协议,它利用下一个标记采样的固有随机性和公共模型来实现差分隐私。我们通过引入RD-扰动器来形式化这一点,该扰动器将来自微调LLM集成的每个模型的输出分布投影到公共LLM输出分布周围的集合上,然后平均投影的分布并从中采样。与DP-SGD需要在训练期间考虑模型架构不同,PMixED是模型无关的,这使得PMixED成为当前部署中非常有吸引力的解决方案。我们的结果表明,PMixED实现了比样本级隐私更强的隐私保证,并且在隐私ε=8的大规模数据集上优于DP-SGD。因此,PMixED提供了一种实用的替代DP训练方法,可以在不牺牲隐私的情况下实现强大的生成效用。
引用
@article{arxiv.2403.15638,
title = {Differentially Private Next-Token Prediction of Large Language Models},
author = {James Flemings and Meisam Razaviyayn and Murali Annavaram},
journal= {arXiv preprint arXiv:2403.15638},
year = {2024}
}