利用公共数据改进私有混洗梯度方法的收敛性
机器学习
2026-02-25 v2
摘要
我们研究差分隐私(DP)凸经验风险最小化(ERM)问题。尽管理论上标准的 DP-SGD 算法已较为成熟,但实际实现通常依赖于混洗梯度方法,即按顺序遍历训练数据,而非每次迭代中进行有放回抽样。尽管这些方法被广泛使用,但私有混洗梯度方法(DP-ShuffleG)的理论隐私-准确性权衡仍未被充分理解,导致理论与实践之间存在差距。在本工作中,我们利用迭代隐私放大(PABI)和 Stein 引理的新颖应用,首次给出了 DP-ShuffleG 的经验超额风险界。我们的结果表明,与 DP-SGD 相比,数据混洗会导致 DP-ShuffleG 的经验超额风险更差。为解决这一局限,我们提出了 Interleaved-ShuffleG,这是一种在私有优化中整合公共数据样本的混合方法。通过交替使用私有和公共样本的优化步骤,Interleaved-ShuffleG 有效降低了经验超额风险。我们的分析引入了一个包含替代目标、不同噪声注入水平和不相似性度量的新优化框架,这可能具有独立的研究价值。我们在多种数据集和任务上的实验证明了 Interleaved-ShuffleG 相对于多个基线的优越性。
引用
@article{arxiv.2502.03652,
title = {Improving the Convergence of Private Shuffled Gradient Methods with Public Data},
author = {Shuli Jiang and Pranay Sharma and Zhiwei Steven Wu and Gauri Joshi},
journal= {arXiv preprint arXiv:2502.03652},
year = {2026}
}
备注
72 pages, 6 figures