论局部隐私线性上下文 Bandit 的最优遗憾
机器学习
2024-04-16 v1 密码学与安全
机器学习
摘要
具有线性奖励函数的上下文 bandit 是 bandit 与在线学习研究中研究最广泛的模型之一。近年来,设计局部隐私线性上下文 bandit 算法的兴趣日益增长,其中上下文和奖励中包含的敏感信息被保护以防止向公众泄露。经典的线性上下文 bandit 算法可通过多种替代方法获得 的累积遗憾上界,但在局部隐私约束下此类遗憾界是否可达仍悬而未决,目前最优结果为 。本文证明,对于局部隐私线性上下文 bandit,确实可以实现 的遗憾上界。我们的解决方案依赖于若干新的算法与分析思想,例如对平均绝对偏差误差的分析以及分层主成分回归,以实现较小的平均绝对偏差误差。
关键词
引用
@article{arxiv.2404.09413,
title = {On the Optimal Regret of Locally Private Linear Contextual Bandit},
author = {Jiachun Li and David Simchi-Levi and Yining Wang},
journal= {arXiv preprint arXiv:2404.09413},
year = {2024}
}