中文

(局部)差分隐私下重尾多臂老虎机的最优速率

机器学习 2022-03-25 v5

摘要

本文研究(局部)差分隐私(DP/LDP)模型中的随机多臂老虎机(MAB)问题。与先前假设有界/次高斯奖励分布的结果不同,我们关注每臂奖励分布仅具有某个v(0,1]v\in (0,1](1+v)(1+v)阶矩的设定。第一部分中,我们在中心ϵ\epsilon-DP模型下研究该问题。我们首先通过开发一种隐私且鲁棒的置信上界(UCB)算法给出近最优结果。随后,我们通过隐私且鲁棒的成功消去(SE)算法改进该结果。最后,我们建立下界以表明改进算法的实例依赖后悔是最优的。第二部分中,我们在ϵ\epsilon-LDP模型下研究该问题。我们提出一种可视为局部隐私且鲁棒版SE算法的算法,其在理论上实现了实例依赖与实例独立后悔的(近)最优速率。我们的结果揭示了有界/次高斯奖励与重尾奖励的隐私MAB问题之间的差异。为取得这些(近)最优速率,我们作为副产品开发了若干新困难实例与隐私鲁棒估计量,或可用于其他相关问题。最后,实验亦支持我们的理论发现并表明算法的有效性。

关键词

引用

@article{arxiv.2106.02575,
  title  = {Optimal Rates of (Locally) Differentially Private Heavy-tailed Multi-Armed Bandits},
  author = {Youming Tao and Yulian Wu and Peng Zhao and Di Wang},
  journal= {arXiv preprint arXiv:2106.02575},
  year   = {2022}
}

备注

Accepted for oral presentation at AISTATS 2022. A preliminary version of this paper was presented at the CCS 2021 workshop Privacy Preserving Machine Learning (PPML'21). In this version, we fixed some typos