中文

随机环境下差分隐私在线学习的近最优算法

机器学习 2024-05-31 v3

摘要

本文研究了在随机环境下、具有bandit与完全信息反馈的差分隐私在线学习问题。对于差分隐私随机bandit,我们提出了基于UCB和Thompson采样的算法,这些算法是anytime的,并达到了最优的O(j:Δj>0ln(T)min{Δj,ϵ})O \left(\sum_{j: \Delta_j>0} \frac{\ln(T)}{\min \left\{\Delta_j, \epsilon \right\}} \right)实例依赖后悔界,其中TT为有限学习时域,Δj\Delta_j表示最优臂与次优臂jj之间的次优性间隙,ϵ\epsilon为所需的隐私参数。对于具有随机奖励的差分隐私完全信息设定,我们给出了Ω(ln(K)min{Δmin,ϵ})\Omega \left(\frac{\ln(K)}{\min \left\{\Delta_{\min}, \epsilon \right\}} \right)的实例依赖后悔下界和Ω(Tln(K)+ln(K)ϵ)\Omega\left(\sqrt{T\ln(K)} + \frac{\ln(K)}{\epsilon}\right)的极小极大下界,其中KK为动作总数,Δmin\Delta_{\min}表示所有次优动作中的最小次优性间隙。对于同一差分隐私完全信息设定,我们还提出了一种ϵ\epsilon-差分隐私算法,其实例依赖后悔与最坏情况后悔分别匹配我们的下界,仅多出log(T)\log(T)因子。

关键词

引用

@article{arxiv.2102.07929,
  title  = {Near-Optimal Algorithms for Differentially Private Online Learning in a Stochastic Environment},
  author = {Bingshan Hu and Zhiming Huang and Nishant A. Mehta and Nidhi Hegde},
  journal= {arXiv preprint arXiv:2102.07929},
  year   = {2024}
}

备注

40 pages. New in v3: (i) Removed Hybrid-UCB (although its analysis is correct to our knowledge); (ii) Added Lazy-DP-TS from UAI 2022 paper of Hu and Hegde (2022)