中文

KL 条件下差分隐私非凸优化的最优速率

机器学习 2024-04-04 v2 密码学与安全 最优化与控制 机器学习

摘要

我们研究满足 (γ,κ)(\gamma,\kappa)-Kurdyka-Łojasiewicz(KL)条件的损失的隐私经验风险最小化(ERM)问题。Polyak-Łojasiewicz(PL)条件是该条件在 κ=2\kappa=2 时的特例。具体地,我们在 ρ\rho 零集中差分隐私(zCDP)约束下研究此问题。当 κ[1,2]\kappa\in[1,2] 且损失函数在足够大区域上 Lipschitz 且光滑时,我们提出一种基于方差缩减梯度下降的新算法,在超额经验风险上达到 O~((dnρ)κ)\tilde{O}\big(\big(\frac{\sqrt{d}}{n\sqrt{\rho}}\big)^\kappa\big) 的速率,其中 nn 为数据集规模、dd 为维度。我们进一步表明该速率近乎最优。当 κ2\kappa \geq 2 且损失为 Lipschitz 与弱凸时,我们表明可通过隐私化近端点方法实现 O~((dnρ)κ)\tilde{O}\big(\big(\frac{\sqrt{d}}{n\sqrt{\rho}}\big)^\kappa\big) 的速率。当 KL 参数未知时,我们给出噪声梯度下降算法的新改进与分析,表明该算法自适应达到 O~((dnρ)2κ4κ)\tilde{O}\big(\big(\frac{\sqrt{d}}{n\sqrt{\rho}}\big)^{\frac{2\kappa}{4-\kappa}}\big) 的速率,在 κ=2\kappa = 2 时近乎最优。我们进一步表明,在不假设 KL 条件时,若算法运行期间梯度始终足够大,同一梯度下降算法可快速收敛至驻点。具体地,我们表明该算法能以快至 O~(dnρ)\tilde{O}\big(\frac{\sqrt{d}}{n\sqrt{\rho}}\big) 且绝不差于 O~((dnρ)1/2)\tilde{O}\big(\big(\frac{\sqrt{d}}{n\sqrt{\rho}}\big)^{1/2}\big) 的速率逼近 Lipschitz、光滑(可能非凸)目标的驻点。后者速率与已知不依赖方差缩减方法的最佳速率相符。

关键词

引用

@article{arxiv.2311.13447,
  title  = {Differentially Private Non-Convex Optimization under the KL Condition with Optimal Rates},
  author = {Michael Menart and Enayat Ullah and Raman Arora and Raef Bassily and Cristóbal Guzmán},
  journal= {arXiv preprint arXiv:2311.13447},
  year   = {2024}
}