回收碎片:利用中间检查点改进私有学习
机器学习
2024-09-18 v2 密码学与安全
摘要
在这项工作中,我们专注于改善最先进差分隐私机器学习(DP ML)方法的精度-方差权衡。首先,我们设计了一个通用框架,利用训练期间的中间检查点聚合来提升 DP ML 技术的精度。具体而言,我们证明在 StackOverflow、CIFAR10 和 CIFAR100 数据集上,基于聚合的训练可比现有最先进技术提供显著的预测精度提升。例如,我们将 DP StackOverflow 的 state-of-the-art 精度在 时提升至 22.74%(相对 +2.06%),在 时提升至 23.90%(相对 +2.09%)。此外,这些增益在训练数据分布周期性变化的设定下被放大。我们还证明,我们的方法在一项专有、生产级 pCVR 任务上于效用与方差方面分别取得 0.54% 与 62.6% 的相对改进。最后,我们开启了对估计 DP ML 模型预测中 DP 噪声所添加不确定性(方差)的探索。我们证明,在损失函数的标准假设下,最后若干检查点的样本方差可良好近似 DP 运行最终模型的方差。经验上,我们展示最后若干检查点可为收敛 DP 模型的方差提供合理的下界。关键的是,本文提出的所有方法均作用于 DP ML 技术的单次训练运行,因此不产生额外隐私代价。
引用
@article{arxiv.2210.01864,
title = {Recycling Scraps: Improving Private Learning by Leveraging Intermediate Checkpoints},
author = {Virat Shejwalkar and Arun Ganesh and Rajiv Mathews and Yarong Mu and Shuang Song and Om Thakkar and Abhradeep Thakurta and Xinyi Zheng},
journal= {arXiv preprint arXiv:2210.01864},
year = {2024}
}
备注
New results on pCVR task