中文

差分隐私下随机决策论在线学习的改进遗憾界

机器学习 2025-06-19 v2 密码学与安全 数据结构与算法

摘要

Hu和Mehta(2024)提出了一个开放问题:在ε-差分隐私条件下,随机决策论在线学习(具有K个动作和T轮)的最优实例相关速率是多少?此前,已知的最佳上界和下界分别为O(log K/Δ_min + log K log T/ε)和Ω(log K/Δ_min + log K/ε)(其中Δ_min为最优动作与第二优动作之间的差距)。本文通过两个新结果部分回答了该开放问题。首先,我们为该问题提供了一个改进的上界O(log K/Δ_min + log²K/ε),该上界与T无关,且仅对K具有对数依赖。其次,为了进一步理解差距,我们引入了确定性设定,即该开放问题的一个较弱设定,在该设定下接收到的损失向量是确定性的。在这一较弱设定下,对原始设定中的分析和算法的直接应用仍然会导致额外的对数因子。我们进行了新颖的分析,证明了在Θ(log K/ε)处上界和下界相匹配。

关键词

引用

@article{arxiv.2502.10997,
  title  = {Improved Regret in Stochastic Decision-Theoretic Online Learning under Differential Privacy},
  author = {Ruihan Wu and Yu-Xiang Wang},
  journal= {arXiv preprint arXiv:2502.10997},
  year   = {2025}
}