中文

面向Bandit的集中差分隐私

机器学习 2024-04-16 v3 密码学与安全 信息论 机器学习 math.IT 统计理论 统计理论

摘要

Bandit(多臂老虎机)是序列学习的理论基础,也是现代推荐系统的算法基础。然而,推荐系统通常依赖用户敏感数据,使得隐私成为关键问题。本文增进了对具有可信中心化决策者的bandit中差分隐私(DP)的理解,尤其是确保零集中差分隐私(zCDP)的含义。首先,我们形式化并比较了取决于所考虑输入与交互协议的不同DP对bandit的适配方式。随后,我们针对三种bandit设置(即有限臂bandit、线性bandit和线性上下文bandit)提出了三种私有算法,分别为AdaC-UCB、AdaC-GOPE和AdaC-OFUL。这三种算法共享一个通用算法蓝图,即高斯机制与自适应片段,以确保良好的隐私-效用权衡。我们分析并给出了这三种算法后悔值的上界。分析表明,在所有这些设置中,施加zCDP的代价相较于忽略隐私所导致的后悔值(渐近地)可忽略不计。接下来,我们以首个具有zCDP的bandit后悔值极小极大下界补充了上界结果。为证明下界,我们阐述了基于耦合与最优传输的新证明技术。最后,我们通过实验验证了针对三种不同bandit设置的理论结果。

关键词

引用

@article{arxiv.2309.00557,
  title  = {Concentrated Differential Privacy for Bandits},
  author = {Achraf Azize and Debabrota Basu},
  journal= {arXiv preprint arXiv:2309.00557},
  year   = {2024}
}

备注

Appears in IEEE SaTML 2024