中文

具有组约束的上下文组合多输出高斯过程_bandits

机器学习 2023-07-11 v2 应用统计 机器学习

摘要

在联邦多臂_bandit 问题中,在保护客户端的最低隐私要求下最大化全局奖励是主要目标。为表述此类问题,我们考虑一个带组和变化动作集的组合上下文_bandit 设定,其中相似的基臂成组到达,且每轮必须选择一个称为超级臂的基臂集合,以在满足所选基臂所属组的奖励约束下最大化超级臂奖励。为允许更大灵活性,我们让每个基臂有两个输出,建模为双输出高斯过程(GP)的输出,其中一个输出用于计算超级臂奖励,另一个用于组奖励。我们随后提出一种新颖的双-UCB GP-bandit 算法,称为阈值组合高斯过程上置信界(TCGP-UCB),其在最大化累积超级臂奖励与满足组奖励约束之间取得平衡,并可调偏向其中之一。我们还定义了一种结合超级臂遗憾与组奖励约束满足的新遗憾概念,并证明 TCGP-UCB 以高概率产生 O~(λ(K)KTγT)\tilde{O}(\sqrt{\lambda^*(K)KT\overline{\gamma}_{T}} ) 遗憾,其中 γT\overline{\gamma}_{T} 为前 TT 轮出现的基臂上下文集合的最大信息增益,KK 为所有轮中最大超级臂基数。最后我们在基于联邦学习设置及内容推荐设置的合成与真实数据实验中表明,我们的算法在满足组约束的同时优于当前非 GP 的最先进组合_bandit 算法。

关键词

引用

@article{arxiv.2111.14778,
  title  = {Contextual Combinatorial Multi-output GP Bandits with Group Constraints},
  author = {Sepehr Elahi and Baran Atalar and Sevda Öğüt and Cem Tekin},
  journal= {arXiv preprint arXiv:2111.14778},
  year   = {2023}
}