洗牌隐私下的线性上下文_bandits
机器学习
2022-05-25 v1
摘要
差分隐私(DP)近来被引入线性上下文_bandits,以正式解决其相关个性化服务(如推荐)中对参与用户的隐私担忧。先前工作主要关注两种 DP 信任模型:中心模型(由中心服务器负责保护用户敏感数据)与(更强的)本地模型(信息需在用户端直接受保护)。然而,在这些隐私模型下学习算法所实现的效用之间存在根本差距,例如,若所有用户在学习周期 内均唯一,中心模型的后悔界为 ,而本地模型为 。本文中,我们旨在通过考虑近期流行的洗牌隐私模型,实现比中心模型更强的信任模型,同时承受比本地模型更小的后悔。我们提出了洗牌信任模型下线性上下文_bandits 的通用算法框架,其中在用户与中心服务器之间存在一个可信洗牌器,在将一批用户数据发送至服务器之前对其进行随机置换。随后,我们用两种具体洗牌协议实例化该框架:一种依赖本地机制的隐私放大,另一种结合了有界范数向量与矩阵求和协议。我们证明,这两种实例化均带来显著优于本地模型的后悔保证,并且若所有用户唯一,潜在可达 阶。我们还在合成数据上通过仿真验证了此后悔行为。最后,在非唯一用户的实际场景下,我们表明洗牌隐私算法的后悔随 缩放,与此情形下中心模型所能达到的结果相匹配。
引用
@article{arxiv.2202.05567,
title = {Shuffle Private Linear Contextual Bandits},
author = {Sayak Ray Chowdhury and Xingyu Zhou},
journal= {arXiv preprint arXiv:2202.05567},
year = {2022}
}