差分隐私核化情境型多臂赌博机
机器学习
2025-01-14 v1 机器学习
摘要
我们考虑了具随机情境的情境型核多臂赌博机问题,其中底层奖励函数属于已知的再生核希尔 space (RKHS)。我们在联合差分隐私约束下研究此问题,其中代理人需要确保查询序列相对于情境和奖励序列的差分隐私。我们提出了一种 novel algorithm,该算法在大类核 family 上实现了 state of the art,并在 T 次查询后达到 error rate 为 ,其中 表示核的有效维度, 为隐私参数。我们的结果基于一种 novel reward function estimator,该估计器同时享有高实用性以及对观察到的奖励和情境的低灵敏度,这对于获得 order optimal 学习性能并改进对隐私参数的依赖至关重要。
关键词
引用
@article{arxiv.2501.07046,
title = {Differentially Private Kernelized Contextual Bandits},
author = {Nikola Pavlovic and Sudeep Salgia and Qing Zhao},
journal= {arXiv preprint arXiv:2501.07046},
year = {2025}
}