中文

具有部分分布式反馈的差分隐私线性_bandits

机器学习 2024-03-22 v2 密码学与安全 数值分析 数值分析

摘要

在本文中,我们研究仅具有部分分布式反馈的全局奖励最大化问题。该问题受到若干真实应用的启发(例如蜂窝网络配置、动态定价和策略选择),其中中央实体采取的行动会影响为全局奖励做出贡献的大量群体。然而,从整个群体收集此类奖励反馈不仅成本极高,而且常引发隐私问题。为解决该问题,我们考虑差分隐私分布式线性 bandits,其中仅从群体中选择一部分用户(称为客户端)参与学习过程,中央服务器通过以差分隐私方式迭代聚合这些客户端的本地反馈,从此类部分反馈中学习全局模型。随后我们提出一个统一的算法学习框架,称为差分隐私分布式分阶段消除(DP-DPE),它可自然地与流行的差分隐私(DP)模型(包括中心 DP、本地 DP 和洗牌 DP)集成。此外,我们证明 DP-DPE 实现了次线性遗憾和次线性通信成本。有趣的是,DP-DPE 还以“免费”方式实现隐私保护,即由于隐私保证带来的额外成本是低阶附加项。另外,作为我们技术的副产品,标准差分隐私线性 bandits 也可实现同样的“免费”隐私结果。最后,我们进行仿真以证实理论结果并展示 DP-DPE 的有效性。

关键词

引用

@article{arxiv.2207.05827,
  title  = {Differentially Private Linear Bandits with Partial Distributed Feedback},
  author = {Fengjiao Li and Xingyu Zhou and Bo Ji},
  journal= {arXiv preprint arXiv:2207.05827},
  year   = {2024}
}

备注

69 pages, this version is an extension from the preliminary one presented at IEEE/IFIP WiOpt 2022 and was accepted to IEEE Transactions on Network Science and Engineering (TNSE)