(局部)差分隐私下重尾多臂老虎机的最优速率
机器学习
2022-03-25 v5
摘要
本文研究(局部)差分隐私(DP/LDP)模型中的随机多臂老虎机(MAB)问题。与先前假设有界/次高斯奖励分布的结果不同,我们关注每臂奖励分布仅具有某个的阶矩的设定。第一部分中,我们在中心-DP模型下研究该问题。我们首先通过开发一种隐私且鲁棒的置信上界(UCB)算法给出近最优结果。随后,我们通过隐私且鲁棒的成功消去(SE)算法改进该结果。最后,我们建立下界以表明改进算法的实例依赖后悔是最优的。第二部分中,我们在-LDP模型下研究该问题。我们提出一种可视为局部隐私且鲁棒版SE算法的算法,其在理论上实现了实例依赖与实例独立后悔的(近)最优速率。我们的结果揭示了有界/次高斯奖励与重尾奖励的隐私MAB问题之间的差异。为取得这些(近)最优速率,我们作为副产品开发了若干新困难实例与隐私鲁棒估计量,或可用于其他相关问题。最后,实验亦支持我们的理论发现并表明算法的有效性。
引用
@article{arxiv.2106.02575,
title = {Optimal Rates of (Locally) Differentially Private Heavy-tailed Multi-Armed Bandits},
author = {Youming Tao and Yulian Wu and Peng Zhao and Di Wang},
journal= {arXiv preprint arXiv:2106.02575},
year = {2022}
}
备注
Accepted for oral presentation at AISTATS 2022. A preliminary version of this paper was presented at the CCS 2021 workshop Privacy Preserving Machine Learning (PPML'21). In this version, we fixed some typos