中文

超越最坏情况的私有经验风险最小化:约束集几何的影响

机器学习 2016-11-22 v3 密码学与安全 机器学习

摘要

经验风险最小化(ERM)是机器学习中的一项标准技术,通过在约束集上最小化损失函数来选择模型。当训练数据集包含私有信息时,自然要使用差分隐私 ERM 算法,该问题自 Chaudhuri 和 Monteleoni(2008)起已有大量研究。私有 ERM 算法输出损失函数的近似最小值,其误差可衡量为与损失函数最优值的差距。当约束集任意时,所需的误差界已得到相当充分的理解 \cite{BassilyST14}。本文中,我们证明约束集的几何性质可用于推导显著更好的结果。具体而言,我们证明差分隐私版本的镜像下降法对 Lipschitz 损失函数可导出 O~(GC/n)\tilde{O}(G_{\mathcal{C}}/n) 形式的误差界,改进了 Bassily、Smith 和 Thakurta(2014)的 O~(p/n)\tilde{O}(\sqrt{p}/n) 界。这里 pp 是问题的维度,nn 是训练集中的数据点数,GCG_{\mathcal{C}} 表示我们优化所针对的约束集的高斯宽度。我们对强凸函数和光滑函数也展示了类似的改进。此外,我们证明当损失函数关于 1\ell_1 范数是 Lipschitz 的,且 C\mathcal{C}1\ell_1-有界的,差分隐私版本的 Frank-Wolfe 算法给出 O~(n2/3)\tilde{O}(n^{-2/3}) 形式的误差界。这涵盖了稀疏线性回归(LASSO)这一重要且常见的情形,其中数据 xix_i 满足 xi1|x_i|_{\infty} \leq 1,且我们在 1\ell_1 球上优化。我们给出了该设置的新下界,结合已知界,表明我们所有的上界都是紧的。

关键词

引用

@article{arxiv.1411.5417,
  title  = {Private Empirical Risk Minimization Beyond the Worst Case: The Effect of the Constraint Set Geometry},
  author = {Kunal Talwar and Abhradeep Thakurta and Li Zhang},
  journal= {arXiv preprint arXiv:1411.5417},
  year   = {2016}
}