中文

$O(1)$光滑DP-SCO单纪元大批量的最优速率

机器学习 2024-10-04 v2 密码学与安全

摘要

本文重新审视了DP随机凸优化(SCO)问题。对于凸光滑损失函数,众所周知,标准DP-SGD(随机梯度下降)在(ϵ,δ)(\epsilon, \delta)-DP下达到最优速率O(LRn+LRplog(1/δ)ϵn),且众所周知,DPSGD的变体可以在单纪元内达到最优速率。然而,批处理梯度复杂度(即自适应优化步骤数),这在如联邦学习等应用中至关重要,仍不为人所充分了解。特别是,所有关于DPSCO的现有工作都要求O\left(\frac{LR}{\sqrt{n}} + \frac{LR \sqrt{p \log(1/\delta)}}{\epsilon n}\right),且众所周知,DP-SGD的变体可以在单纪元内达到最优速率。然而,批处理梯度复杂度(即自适应优化步骤数),这在如联邦学习等应用中至关重要,仍不为人所充分了解。特别是,所有关于DP-SCO的现有工作都要求\Omega(n)批处理梯度步骤、多个纪元,或要求损失函数为凸。我们提出一种算法,AcceleratedDPSRGD(加速随机递归梯度下降),绕过了过去工作的局限性:它在单纪元内使用批处理梯度步骤、多个纪元,或要求损失函数为凸。我们提出一种算法,Accelerated-DP-SRGD(加速随机递归梯度下降),绕过了过去工作的局限性:它在单纪元内使用\sqrt{n}批处理梯度步骤(批量大小为批处理梯度步骤(批量大小为\sqrt{n})即可达到DPSCO的最优速率(多项级数因子),可通过裁剪实现对任意(非凸)损失函数的隐私保护。若全局最小值位于约束集中,则可进一步改进为)即可达到DP-SCO的最优速率(多项级数因子),可通过裁剪实现对任意(非凸)损失函数的隐私保护。若全局最小值位于约束集中,则可进一步改进为n^{1/4}批处理梯度步骤(批量大小为批处理梯度步骤(批量大小为n^{3/4}$)。为实现此目标,我们的算法结合了三个关键要素:一种变体随机递归梯度(SRG)、加速梯度下降,以及来自DP持续计数的相关噪声生成。

关键词

引用

@article{arxiv.2406.02716,
  title  = {Optimal Rates for $O(1)$-Smooth DP-SCO with a Single Epoch and Large Batches},
  author = {Christopher A. Choquette-Choo and Arun Ganesh and Abhradeep Thakurta},
  journal= {arXiv preprint arXiv:2406.02716},
  year   = {2024}
}

备注

Differences from v1: Stronger results assuming global minimizer in constraint set, more detailed comparison to past work, cut empirical section