中文

差分隐私核化情境型多臂赌博机

机器学习 2025-01-14 v1 机器学习

摘要

我们考虑了具随机情境的情境型核多臂赌博机问题,其中底层奖励函数属于已知的再生核希尔 space (RKHS)。我们在联合差分隐私约束下研究此问题,其中代理人需要确保查询序列相对于情境和奖励序列的差分隐私。我们提出了一种 novel algorithm,该算法在大类核 family 上实现了 state of the art,并在 T 次查询后达到 error rate 为 O(γTT+γTTε)\mathcal{O}\left(\sqrt{\frac{\gamma_T}{T}} + \frac{\gamma_T}{T \varepsilon}\right),其中 γT\gamma_T 表示核的有效维度,ε>0\varepsilon > 0 为隐私参数。我们的结果基于一种 novel reward function estimator,该估计器同时享有高实用性以及对观察到的奖励和情境的低灵敏度,这对于获得 order optimal 学习性能并改进对隐私参数的依赖至关重要。

关键词

引用

@article{arxiv.2501.07046,
  title  = {Differentially Private Kernelized Contextual Bandits},
  author = {Nikola Pavlovic and Sudeep Salgia and Qing Zhao},
  journal= {arXiv preprint arXiv:2501.07046},
  year   = {2025}
}