中文

(局部)差分隐私下的组合半_bandit问题

机器学习 2020-07-06 v2 机器学习

摘要

本文研究组合半_bandit(CSB),其为经典多臂_bandit(MAB)在差分隐私(DP)及更强的局部差分隐私(LDP)设定下的扩展。由于在 CSB 中服务器从用户处接收更多信息,通常会导致对数据维度的额外依赖,这是隐私保护学习中臭名昭著的副作用。然而对于两种常见平滑假设下的 CSB(\cite{kveton2015tight,chen2016combinatorial}),我们表明消除该副作用是可能的。具体而言,对于 BB_{\infty} 有界平滑 CSB 在 ε\varepsilon-LDP 或 ε\varepsilon-DP 下,我们提出新算法并给出匹配下界,证明了最优后悔界分别为 Θ(mB2lnTΔϵ2)\Theta(\frac{mB^2_{\infty}\ln T } {\Delta\epsilon^2})Θ~(mB2lnTΔϵ)\tilde{\Theta}(\frac{mB^2_{\infty}\ln T} { \Delta\epsilon}),其中 TT 为时间周期,Δ\Delta 为奖励间隙,mm 为基础臂数量。对于 ε\varepsilon-DP 下的 B1B_1 有界平滑 CSB,我们同样通过上界与下界证明了最优后悔界为 Θ~(mKB12lnTΔϵ)\tilde{\Theta}(\frac{mKB^2_1\ln T} {\Delta\epsilon}),其中 KK 为每轮最大反馈数。上述所有结果几乎匹配相应的非隐私最优速率,意味着在上述常见设定中,(局部)差分隐私 CSB 无需付出额外代价。

关键词

引用

@article{arxiv.2006.00706,
  title  = {(Locally) Differentially Private Combinatorial Semi-Bandits},
  author = {Xiaoyu Chen and Kai Zheng and Zixin Zhou and Yunchang Yang and Wei Chen and Liwei Wang},
  journal= {arXiv preprint arXiv:2006.00706},
  year   = {2020}
}