中文

论局部隐私线性上下文 Bandit 的最优遗憾

机器学习 2024-04-16 v1 密码学与安全 机器学习

摘要

具有线性奖励函数的上下文 bandit 是 bandit 与在线学习研究中研究最广泛的模型之一。近年来,设计局部隐私线性上下文 bandit 算法的兴趣日益增长,其中上下文和奖励中包含的敏感信息被保护以防止向公众泄露。经典的线性上下文 bandit 算法可通过多种替代方法获得 O~(T)\tilde O(\sqrt{T}) 的累积遗憾上界,但在局部隐私约束下此类遗憾界是否可达仍悬而未决,目前最优结果为 O~(T3/4)\tilde O(T^{3/4})。本文证明,对于局部隐私线性上下文 bandit,确实可以实现 O~(T)\tilde O(\sqrt{T}) 的遗憾上界。我们的解决方案依赖于若干新的算法与分析思想,例如对平均绝对偏差误差的分析以及分层主成分回归,以实现较小的平均绝对偏差误差。

关键词

引用

@article{arxiv.2404.09413,
  title  = {On the Optimal Regret of Locally Private Linear Contextual Bandit},
  author = {Jiachun Li and David Simchi-Levi and Yining Wang},
  journal= {arXiv preprint arXiv:2404.09413},
  year   = {2024}
}