中文

利用公共数据改进私有混洗梯度方法的收敛性

机器学习 2026-02-25 v2

摘要

我们研究差分隐私(DP)凸经验风险最小化(ERM)问题。尽管理论上标准的 DP-SGD 算法已较为成熟,但实际实现通常依赖于混洗梯度方法,即按顺序遍历训练数据,而非每次迭代中进行有放回抽样。尽管这些方法被广泛使用,但私有混洗梯度方法(DP-ShuffleG)的理论隐私-准确性权衡仍未被充分理解,导致理论与实践之间存在差距。在本工作中,我们利用迭代隐私放大(PABI)和 Stein 引理的新颖应用,首次给出了 DP-ShuffleG 的经验超额风险界。我们的结果表明,与 DP-SGD 相比,数据混洗会导致 DP-ShuffleG 的经验超额风险更差。为解决这一局限,我们提出了 Interleaved-ShuffleG,这是一种在私有优化中整合公共数据样本的混合方法。通过交替使用私有和公共样本的优化步骤,Interleaved-ShuffleG 有效降低了经验超额风险。我们的分析引入了一个包含替代目标、不同噪声注入水平和不相似性度量的新优化框架,这可能具有独立的研究价值。我们在多种数据集和任务上的实验证明了 Interleaved-ShuffleG 相对于多个基线的优越性。

关键词

引用

@article{arxiv.2502.03652,
  title  = {Improving the Convergence of Private Shuffled Gradient Methods with Public Data},
  author = {Shuli Jiang and Pranay Sharma and Zhiwei Steven Wu and Gauri Joshi},
  journal= {arXiv preprint arXiv:2502.03652},
  year   = {2026}
}

备注

72 pages, 6 figures