中文

洗牌隐私下的线性上下文_bandits

机器学习 2022-05-25 v1

摘要

差分隐私(DP)近来被引入线性上下文_bandits,以正式解决其相关个性化服务(如推荐)中对参与用户的隐私担忧。先前工作主要关注两种 DP 信任模型:中心模型(由中心服务器负责保护用户敏感数据)与(更强的)本地模型(信息需在用户端直接受保护)。然而,在这些隐私模型下学习算法所实现的效用之间存在根本差距,例如,若所有用户在学习周期 TT 内均唯一,中心模型的后悔界为 O~(T)\tilde{O}(\sqrt{T}),而本地模型为 O~(T3/4)\tilde{O}(T^{3/4})。本文中,我们旨在通过考虑近期流行的洗牌隐私模型,实现比中心模型更强的信任模型,同时承受比本地模型更小的后悔。我们提出了洗牌信任模型下线性上下文_bandits 的通用算法框架,其中在用户与中心服务器之间存在一个可信洗牌器,在将一批用户数据发送至服务器之前对其进行随机置换。随后,我们用两种具体洗牌协议实例化该框架:一种依赖本地机制的隐私放大,另一种结合了有界范数向量与矩阵求和协议。我们证明,这两种实例化均带来显著优于本地模型的后悔保证,并且若所有用户唯一,潜在可达 O~(T3/5)\tilde{O}(T^{3/5}) 阶。我们还在合成数据上通过仿真验证了此后悔行为。最后,在非唯一用户的实际场景下,我们表明洗牌隐私算法的后悔随 O~(T2/3)\tilde{O}(T^{2/3}) 缩放,与此情形下中心模型所能达到的结果相匹配。

关键词

引用

@article{arxiv.2202.05567,
  title  = {Shuffle Private Linear Contextual Bandits},
  author = {Sayak Ray Chowdhury and Xingyu Zhou},
  journal= {arXiv preprint arXiv:2202.05567},
  year   = {2022}
}