中文

局部差分隐私(上下文)Bandits 学习

机器学习 2021-01-18 v4 机器学习

摘要

本文研究局部差分隐私(LDP)bandits 学习。首先,我们提出简单的黑盒归约框架,可解决一大类带 LDP 保证的无上下文 bandits 学习问题。基于我们的框架,我们改进了先前具有单点反馈的隐私 bandits 学习最优结果,例如隐私 Bandits 凸优化,并获得了 LDP 下具有多点反馈的 Bandits 凸优化(BCO)的首个结果。LDP 保证与黑盒特性使我们的框架相较于先前专门设计且相对较弱的差分隐私(DP)无上下文 bandits 算法在真实应用中更具吸引力。进一步,我们将 (ε,δ)(\varepsilon, \delta)-LDP 算法推广至广义线性 Bandits,其具有次线性后悔 O~(T3/4/ε)\tilde{O}(T^{3/4}/\varepsilon) 且被推测为近乎最优。注意到已有 DP 上下文线性 bandits 的 Ω(T)\Omega(T) 下界(Shariff & Sheffe, 2018),我们的结果揭示了 LDP 与 DP 上下文 bandits 学习之间的根本差异。

关键词

引用

@article{arxiv.2006.00701,
  title  = {Locally Differentially Private (Contextual) Bandits Learning},
  author = {Kai Zheng and Tianle Cai and Weiran Huang and Zhenguo Li and Liwei Wang},
  journal= {arXiv preprint arXiv:2006.00701},
  year   = {2021}
}

备注

Accepted by NeurIPS 2020