多臂老虎机的差分隐私:它是什么及其代价?
机器学习
2020-06-25 v2 机器学习
摘要
基于差分隐私(DP)框架,我们引入并统一了多臂老虎机算法的隐私定义。我们用统一的图模型表示该框架,并用它来连接隐私定义。我们推导并对比了满足这些定义的老虎机算法的后悔下界。我们利用统一的证明技术来得到所有下界。我们表明,对于它们中的所有情况,学习者的后悔都按依赖于隐私水平 的乘性因子增加。我们观察到,当我们不要求奖励的本地差分隐私时,该依赖性更弱。
引用
@article{arxiv.1905.12298,
title = {Differential Privacy for Multi-armed Bandits: What Is It and What Is Its Cost?},
author = {Debabrota Basu and Christos Dimitrakakis and Aristide Tossou},
journal= {arXiv preprint arXiv:1905.12298},
year = {2020}
}
备注
27 pages, 1 figure, 2 tables, 14 theorems