差分隐私下随机决策论在线学习的改进遗憾界
机器学习
2025-06-19 v2 密码学与安全
数据结构与算法
摘要
Hu和Mehta(2024)提出了一个开放问题:在ε-差分隐私条件下,随机决策论在线学习(具有K个动作和T轮)的最优实例相关速率是多少?此前,已知的最佳上界和下界分别为O(log K/Δ_min + log K log T/ε)和Ω(log K/Δ_min + log K/ε)(其中Δ_min为最优动作与第二优动作之间的差距)。本文通过两个新结果部分回答了该开放问题。首先,我们为该问题提供了一个改进的上界O(log K/Δ_min + log²K/ε),该上界与T无关,且仅对K具有对数依赖。其次,为了进一步理解差距,我们引入了确定性设定,即该开放问题的一个较弱设定,在该设定下接收到的损失向量是确定性的。在这一较弱设定下,对原始设定中的分析和算法的直接应用仍然会导致额外的对数因子。我们进行了新颖的分析,证明了在Θ(log K/ε)处上界和下界相匹配。
引用
@article{arxiv.2502.10997,
title = {Improved Regret in Stochastic Decision-Theoretic Online Learning under Differential Privacy},
author = {Ruihan Wu and Yu-Xiang Wang},
journal= {arXiv preprint arXiv:2502.10997},
year = {2025}
}