中文

差分隐私下的级联赌博机

机器学习 2021-06-07 v2

摘要

本文研究级联赌博机中的差分隐私(DP)和本地差分隐私(LDP)。在 DP 下,我们提出一种算法,保证 ϵ\epsilon-不可区分性,并获得对于任意小的 ξ\xiO((logTϵ)1+ξ)\mathcal{O}((\frac{\log T}{\epsilon})^{1+\xi}) 的遗憾界。这相比先前 O(log3Tϵ)\mathcal{O}(\frac{\log^3 T}{\epsilon}) 遗憾的工作有显著改进。在 (ϵ\epsilon,δ\delta)-LDP 下,我们通过隐私预算 ϵ\epsilon 与错误概率 δ\delta 之间的权衡,放宽了 K2K^2 依赖,并获得 O(Klog(1/δ)logTϵ2)\mathcal{O}(\frac{K\log (1/\delta) \log T}{\epsilon^2}) 的遗憾界,其中 KK 为臂子集的大小。通过对组合性质的分析,该结果对高斯机制和拉普拉斯机制均成立。我们的结果推广到组合半赌博机。我们给出了 DP 和 LDP 级联赌博机的相应下界。大量实验证实了我们的理论发现。

关键词

引用

@article{arxiv.2105.11126,
  title  = {Cascading Bandit under Differential Privacy},
  author = {Kun Wang and Jing Dong and Baoxiang Wang and Shuai Li and Shuo Shao},
  journal= {arXiv preprint arXiv:2105.11126},
  year   = {2021}
}