随机环境下差分隐私在线学习的近最优算法
机器学习
2024-05-31 v3
摘要
本文研究了在随机环境下、具有bandit与完全信息反馈的差分隐私在线学习问题。对于差分隐私随机bandit,我们提出了基于UCB和Thompson采样的算法,这些算法是anytime的,并达到了最优的实例依赖后悔界,其中为有限学习时域,表示最优臂与次优臂之间的次优性间隙,为所需的隐私参数。对于具有随机奖励的差分隐私完全信息设定,我们给出了的实例依赖后悔下界和的极小极大下界,其中为动作总数,表示所有次优动作中的最小次优性间隙。对于同一差分隐私完全信息设定,我们还提出了一种-差分隐私算法,其实例依赖后悔与最坏情况后悔分别匹配我们的下界,仅多出因子。
引用
@article{arxiv.2102.07929,
title = {Near-Optimal Algorithms for Differentially Private Online Learning in a Stochastic Environment},
author = {Bingshan Hu and Zhiming Huang and Nishant A. Mehta and Nidhi Hegde},
journal= {arXiv preprint arXiv:2102.07929},
year = {2024}
}
备注
40 pages. New in v3: (i) Removed Hybrid-UCB (although its analysis is correct to our knowledge); (ii) Added Lazy-DP-TS from UAI 2022 paper of Hu and Hegde (2022)