保持局部隐私的受损 Bandit
机器学习
2017-11-06 v2 机器学习
摘要
我们研究了一种随机多臂老虎机 (MAB) 问题的变体,其中奖励是受损的。在这个受在线推荐系统中隐私保护启发的框架中,目标是在观察通过已知参数的随机受损过程对这些奖励进行变换的基础上,最大化(未观测到的)奖励之和。我们给出了这种受损设定下任意 bandit 算法期望遗憾的下界。我们设计了一个频率派算法 KLUCB-CF 和一个贝叶斯算法 TS-CF,并给出了它们的遗憾上界。我们还提供了适当的受损参数以保证期望的局部隐私水平,并分析了这如何影响遗憾。最后,我们提出了一些证实我们分析的实验结果。
引用
@article{arxiv.1708.05033,
title = {Corrupt Bandits for Preserving Local Privacy},
author = {Pratik Gajane and Tanguy Urvoy and Emilie Kaufmann},
journal= {arXiv preprint arXiv:1708.05033},
year = {2017}
}