中文

私有随机决策论在线学习的最优间隙相关遗憾

机器学习 2026-05-29 v1 机器学习

摘要

我们研究具有完全信息和事件级纯差分隐私的随机决策论在线学习。Hu 和 Mehta 提出的 COLT 开放问题要求确定在纯事件级差分隐私下,随机决策论在线学习的最优间隙相关遗憾率。对于 KK 个动作,损失在 [0,1][0,1] 中,且唯一最优动作与次优动作之间的间隙为 Δmin\Delta_{\min},已知下界为 logKmin{Δmin,ε} \frac{\log K}{\min\{\Delta_{\min},\varepsilon\}} 量级,或者等价地,在通用常数范围内,为 logKΔmin+logKε \frac{\log K}{\Delta_{\min}}+\frac{\log K}{\varepsilon} 量级。我们给出一个无水平线的纯差分隐私算法,并证明对于任意水平线 TT,显式遗憾界为 RegT1000(logKΔmin+logKε) \operatorname{Reg}_T \le 1000 \cdot \left(\frac{\log K}{\Delta_{\min}}+\frac{\log K}{\varepsilon}\right) 。数值常数未优化。该算法将时间划分为指数增长的块,在每个块内执行单一动作,并通过应用于前一块的数据无关随机前缀的指数机制选择下一个动作。随机前缀将块遗憾转化为所有前缀长度上 softmax 选择误差的总和。一个单一的熵势参数以 logK/ε\log K/\varepsilon 的成本控制所有隐私主导的大间隙动作。

关键词

引用

@article{arxiv.2605.29148,
  title  = {Optimal Gap-Dependent Regret for Private Stochastic Decision-Theoretic Online Learning},
  author = {Tommaso Cesari and Roberto Colomboni},
  journal= {arXiv preprint arXiv:2605.29148},
  year   = {2026}
}