中文

鲁棒且差分隐私的随机线性_bandit

机器学习 2023-04-25 v1 密码学与安全 机器学习

摘要

本文中,我们在差分隐私、鲁棒性与批量观测的附加要求下研究随机线性 bandit 问题。具体而言,我们假设 adversary 在每批中随机选择恒定比例的观测奖励,将其替换为任意数值。我们提出了在两种隐私模型下使用对数批量查询的 arm elimination 算法的差分隐私且鲁棒变体,并给出了两种设定下的后悔界。在第一种模型中,每轮中的每个奖励由潜在不同的客户端报告,这退化为标准局部差分隐私(LDP)。在第二种模型中,每个动作由不同客户端“拥有”,该客户端可聚合多次查询的奖励并对聚合响应进行隐私化。据我们所知,我们的算法是首个在随机线性 bandit 问题中同时提供差分隐私与对抗鲁棒性的算法。

关键词

引用

@article{arxiv.2304.11741,
  title  = {Robust and differentially private stochastic linear bandits},
  author = {Vasileios Charisopoulos and Hossein Esfandiari and Vahab Mirrokni},
  journal= {arXiv preprint arXiv:2304.11741},
  year   = {2023}
}

备注

25 pages