中文

洗牌模型下差分隐私的多臂老虎机算法

机器学习 2021-10-29 v3 密码学与安全

摘要

我们给出了洗牌模型下多臂老虎机(MAB)问题的 (ε,δ)(\varepsilon,\delta)-差分隐私算法,其分布相关 regret 为 O((a[k]:Δa>0logTΔa)+klog1δlogTε)O\left(\left(\sum_{a\in [k]:\Delta_a>0}\frac{\log T}{\Delta_a}\right)+\frac{k\sqrt{\log\frac{1}{\delta}}\log T}{\varepsilon}\right),分布无关 regret 为 O(kTlogT+klog1δlogTε)O\left(\sqrt{kT\log T}+\frac{k\sqrt{\log\frac{1}{\delta}}\log T}{\varepsilon}\right),其中 TT 为轮数,Δa\Delta_a 为臂 aa 的次优间隙,kk 为臂的总数。我们的上界几乎匹配集中式模型已知最优算法的 regret,并显著优于局部模型下已知最优算法。

关键词

引用

@article{arxiv.2106.02900,
  title  = {Differentially Private Multi-Armed Bandits in the Shuffle Model},
  author = {Jay Tenenbaum and Haim Kaplan and Yishay Mansour and Uri Stemmer},
  journal= {arXiv preprint arXiv:2106.02900},
  year   = {2021}
}