中文

全局差分隐私下伯努利型多臂赌博机的最优 regret

机器学习 2025-05-12 v1 密码学与安全 信息论 机器学习 math.IT 统计理论 统计理论

摘要

随着序列学习算法日益应用于实际场景,如何在保持实用性的同时确保数据隐私已成为迫切问题。在此背景下,针对 ϵ\epsilon 全局差分隐私 (DP) 下的随机多臂赌博机 regret 进行了广泛研究。与无 DP 的多臂赌博机不同,此设置下已知的最优 regret 下界与上界之间存在显著差距,尽管二者在数量级上“匹配”。因此,我们重新审视 ϵ\epsilon 全局 DP 算法在伯努利型多臂赌博机下的 regret 下界与上界,并对两者均进行改进。首先,我们证明了一个更紧的 regret 下界,涉及一种新颖的信息论量量,用于刻画 ϵ\epsilon 全局 DP 在随机多臂赌博机中难度。我们的下界在所有 ϵ\epsilon 值上均严格改进于现有结果。随后,我们挑选两个渐近最优的多臂赌博机算法,即 DP-KLUCB 和 DP-IMED,提出其 DP 版本,采用统一蓝图:(a) 按臂依赖性划分为不同阶段运行,(b) 添加拉普拉斯噪声以实现隐私。对于伯努利型多臂赌博机,我们分析了这些算法的 regret,表明其 asymptotic regret 与我们下界一致,误差接近常数 1。此结果驳斥了“忘记过去奖励是设计最优多臂赌博机算法在全局 DP 下必需的猜想”。我们算法的核心是一种新的浓度不等式,用于处理拉普拉斯机制下伯努利变量和的和,这是 DP 版本的 Chernoff 界。该结果在 DP 文献中普遍有用,因为其通常将拉普拉斯噪声和随机变量浓度分别处理,而我们将二者耦合,从而得到更紧的界。

关键词

引用

@article{arxiv.2505.05613,
  title  = {Optimal Regret of Bernoulli Bandits under Global Differential Privacy},
  author = {Achraf Azize and Yulian Wu and Junya Honda and Francesco Orabona and Shinji Ito and Debabrota Basu},
  journal= {arXiv preprint arXiv:2505.05613},
  year   = {2025}
}