差分隐私情境线性_bandit
机器学习
2018-10-02 v1 机器学习
摘要
我们研究情境线性 bandit 问题,这是标准随机多臂 bandit (MAB) 问题的一个版本,其中学习者依次选择动作以最大化奖励,该奖励还依赖于每轮用户提供的情境。尽管情境是任意或对抗选择的,奖励被假定为编码情境与所选动作的特征向量的随机函数。我们的目标是为情境线性 bandit 问题设计隐私学习者。我们首先表明,使用差分隐私的标准定义会导致线性后悔。因此,我们转而采用联合差分隐私的概念,其中我们假设第 天选择的动作仅透露给用户 ,从而当天无需保密,仅需在后续日子保密。我们给出一种通用方案,利用基于树的算法将经典 linear-UCB 算法转化为联合差分隐私算法。我们随后施加高斯噪声或 Wishart 噪声以实现联合差分隐私算法,并界定所得算法的后悔界。此外,我们给出 MAB 问题任意隐私算法必须承受的额外后悔的首个下界。
引用
@article{arxiv.1810.00068,
title = {Differentially Private Contextual Linear Bandits},
author = {Roshan Shariff and Or Sheffet},
journal= {arXiv preprint arXiv:1810.00068},
year = {2018}
}
备注
21 pages, 5 figures; to appear in NIPS 2018