$O(1)$光滑DP-SCO单纪元大批量的最优速率
机器学习
2024-10-04 v2 密码学与安全
摘要
本文重新审视了DP随机凸优化(SCO)问题。对于凸光滑损失函数,众所周知,标准DP-SGD(随机梯度下降)在( ϵ , δ ) (\epsilon, \delta) ( ϵ , δ ) -DP下达到最优速率O ( L R n + L R p log ( 1 / δ ) ϵ n ) ,且众所周知, D P − S G D 的变体可以在单纪元内达到最优速率。然而,批处理梯度复杂度(即自适应优化步骤数),这在如联邦学习等应用中至关重要,仍不为人所充分了解。特别是,所有关于 D P − S C O 的现有工作都要求 O\left(\frac{LR}{\sqrt{n}} + \frac{LR \sqrt{p \log(1/\delta)}}{\epsilon n}\right),且众所周知,DP-SGD的变体可以在单纪元内达到最优速率。然而,批处理梯度复杂度(即自适应优化步骤数),这在如联邦学习等应用中至关重要,仍不为人所充分了解。特别是,所有关于DP-SCO的现有工作都要求 O ( n L R + ϵ n L R p l o g ( 1/ δ ) ) ,且众所周知, D P − S G D 的变体可以在单纪元内达到最优速率。然而,批处理梯度复杂度(即自适应优化步骤数),这在如联邦学习等应用中至关重要,仍不为人所充分了解。特别是,所有关于 D P − S C O 的现有工作都要求 \Omega(n)批处理梯度步骤、多个纪元,或要求损失函数为凸。我们提出一种算法, A c c e l e r a t e d − D P − S R G D (加速随机递归梯度下降),绕过了过去工作的局限性:它在单纪元内使用 批处理梯度步骤、多个纪元,或要求损失函数为凸。我们提出一种算法,Accelerated-DP-SRGD(加速随机递归梯度下降),绕过了过去工作的局限性:它在单纪元内使用 批处理梯度步骤、多个纪元,或要求损失函数为凸。我们提出一种算法, A cce l er a t e d − D P − S R G D (加速随机递归梯度下降),绕过了过去工作的局限性:它在单纪元内使用 \sqrt{n}批处理梯度步骤(批量大小为 批处理梯度步骤(批量大小为 批处理梯度步骤(批量大小为 \sqrt{n})即可达到 D P − S C O 的最优速率(多项级数因子),可通过裁剪实现对任意(非凸)损失函数的隐私保护。若全局最小值位于约束集中,则可进一步改进为 )即可达到DP-SCO的最优速率(多项级数因子),可通过裁剪实现对任意(非凸)损失函数的隐私保护。若全局最小值位于约束集中,则可进一步改进为 )即可达到 D P − S C O 的最优速率(多项级数因子),可通过裁剪实现对任意(非凸)损失函数的隐私保护。若全局最小值位于约束集中,则可进一步改进为 n^{1/4}批处理梯度步骤(批量大小为 批处理梯度步骤(批量大小为 批处理梯度步骤(批量大小为 n^{3/4}$)。为实现此目标,我们的算法结合了三个关键要素:一种变体随机递归梯度(SRG)、加速梯度下降,以及来自DP持续计数的相关噪声生成。
引用
@article{arxiv.2406.02716,
title = {Optimal Rates for $O(1)$-Smooth DP-SCO with a Single Epoch and Large Batches},
author = {Christopher A. Choquette-Choo and Arun Ganesh and Abhradeep Thakurta},
journal= {arXiv preprint arXiv:2406.02716},
year = {2024}
}
备注
Differences from v1: Stronger results assuming global minimizer in constraint set, more detailed comparison to past work, cut empirical section