中文

差分隐私随机线性_bandits:(几乎)免费获得

机器学习 2022-07-08 v1 密码学与安全

摘要

本文针对中心化、本地与洗牌模型中的随机线性 bandit 问题提出差分隐私算法。在中心化模型中,我们取得了与最优非隐私算法几乎相同的后悔值,意味着我们免费获得了隐私。具体而言,我们取得了 O~(T+1ϵ)\tilde{O}(\sqrt{T}+\frac{1}{\epsilon}) 的后悔值,匹配已知的隐私线性 bandit 下界,而此前最优已知算法取得 O~(1ϵT)\tilde{O}(\frac{1}{\epsilon}\sqrt{T})。在本地情形下,我们取得 O~(1ϵT)\tilde{O}(\frac{1}{\epsilon}{\sqrt{T}}) 的后悔值,对常数 ϵ\epsilon 匹配非隐私后悔值,但在 ϵ\epsilon 较小时承受后悔惩罚。在洗牌模型中,我们也取得 O~(T+1ϵ)\tilde{O}(\sqrt{T}+\frac{1}{\epsilon}) 的后悔值,而此前最优已知算法承受 O~(1ϵT3/5)\tilde{O}(\frac{1}{\epsilon}{T^{3/5}}) 的后悔值。我们的数值评估验证了理论结果。

关键词

引用

@article{arxiv.2207.03445,
  title  = {Differentially Private Stochastic Linear Bandits: (Almost) for Free},
  author = {Osama A. Hanna and Antonious M. Girgis and Christina Fragouli and Suhas Diggavi},
  journal= {arXiv preprint arXiv:2207.03445},
  year   = {2022}
}