(私有)带分布式偏置反馈的核化_bandit问题
机器学习
2023-02-08 v2 数值分析
数值分析
摘要
在本文中,我们研究带分布式偏置反馈的核化_bandit问题。该问题受若干真实世界应用(如动态定价、蜂窝网络配置和策略制定)的启发,其中来自大群体的用户对中央实体所选动作的奖励做出贡献,但难以从所有用户收集反馈。相反,可能仅能获得来自用户子集的偏置反馈(由于用户异质性)。除此类部分偏置反馈外,我们还面临由于通信成本和计算复杂度带来的两个实际挑战。为应对这些挑战,我们精心设计了新的\emph{分布式阶段后批量消除(\texttt{DPBE})}算法,该算法分阶段采样用户以收集反馈从而降低偏置,并在每阶段内采用\emph{最大方差缩减}批量选择动作。通过恰当选择阶段长度、批大小和用于消除次优动作的置信宽度,我们表明 \texttt{DPBE} 实现了 的次线性后悔,其中 是可调的用户采样参数。此外,与一些最先进算法的变体(最初为标准核化_bandit开发)相比,\texttt{DPBE} 能显著降低分布式核化_bandit中的通信成本和计算复杂度。进一步,通过结合各种\emph{差分隐私}模型(包括中心、本地和洗牌模型),我们将 \texttt{DPBE} 推广以为参与分布式学习过程的用户提供隐私保证。最后,我们进行了大量仿真以验证理论结果并评估实证性能。
引用
@article{arxiv.2301.12061,
title = {(Private) Kernelized Bandits with Distributed Biased Feedback},
author = {Fengjiao Li and Xingyu Zhou and Bo Ji},
journal= {arXiv preprint arXiv:2301.12061},
year = {2023}
}
备注
This work has been accepted by ACM SIGMETRICS 2023