中文

在线学习的差分隐私代价

机器学习 2017-06-15 v2 机器学习

摘要

我们针对全信息和bandit设置下的在线线性优化问题设计了差分隐私算法,具有最优的O~(T)\tilde{O}(\sqrt{T})后悔界。在全信息设置下,我们的结果表明ϵ\epsilon-差分隐私可以免费保证——具体而言,后悔界随O(T)+O~(1ϵ)O(\sqrt{T})+\tilde{O}\left(\frac{1}{\epsilon}\right)缩放。对于bandit线性优化,以及作为特例的非随机多臂bandit,所提算法达到了O~(1ϵT)\tilde{O}\left(\frac{1}{\epsilon}\sqrt{T}\right)的后悔值,而先前已知的最佳后悔界为O~(1ϵT23)\tilde{O}\left(\frac{1}{\epsilon}T^{\frac{2}{3}}\right)

关键词

引用

@article{arxiv.1701.07953,
  title  = {The Price of Differential Privacy For Online Learning},
  author = {Naman Agarwal and Karan Singh},
  journal= {arXiv preprint arXiv:1701.07953},
  year   = {2017}
}

备注

To appear in the Proceedings of the 34th International Conference on Machine Learning (ICML), Sydney, Australia, 2017