(局部)差分隐私下的组合半_bandit问题
机器学习
2020-07-06 v2 机器学习
摘要
本文研究组合半_bandit(CSB),其为经典多臂_bandit(MAB)在差分隐私(DP)及更强的局部差分隐私(LDP)设定下的扩展。由于在 CSB 中服务器从用户处接收更多信息,通常会导致对数据维度的额外依赖,这是隐私保护学习中臭名昭著的副作用。然而对于两种常见平滑假设下的 CSB(\cite{kveton2015tight,chen2016combinatorial}),我们表明消除该副作用是可能的。具体而言,对于 有界平滑 CSB 在 -LDP 或 -DP 下,我们提出新算法并给出匹配下界,证明了最优后悔界分别为 或 ,其中 为时间周期, 为奖励间隙, 为基础臂数量。对于 -DP 下的 有界平滑 CSB,我们同样通过上界与下界证明了最优后悔界为 ,其中 为每轮最大反馈数。上述所有结果几乎匹配相应的非隐私最优速率,意味着在上述常见设定中,(局部)差分隐私 CSB 无需付出额外代价。
引用
@article{arxiv.2006.00706,
title = {(Locally) Differentially Private Combinatorial Semi-Bandits},
author = {Xiaoyu Chen and Kai Zheng and Zixin Zhou and Yunchang Yang and Wei Chen and Liwei Wang},
journal= {arXiv preprint arXiv:2006.00706},
year = {2020}
}