中文

深度分层赌博机

机器学习 2022-02-04 v1 机器学习

摘要

动作的平均奖励常常相关。这些相关性的形式可能复杂且先验未知,例如用户对推荐产品及其类别的偏好。为最大化统计效率,在学习时利用这些相关性十分重要。我们构建了该问题的一种赌博机变体,其中平均动作奖励的相关性由带潜变量的分层贝叶斯模型表示。由于该层次可具有多层,我们称之为深度。我们针对此问题提出一种分层 Thompson 采样算法(HierTS),并展示如何对高斯层次高效实现。该高效实现得益于一种新颖的精确后验分层表示,其本身具有独立意义。我们利用此精确后验分析了 HierTS 在高斯赌博机中的贝叶斯遗憾。我们的分析反映了问题的结构,即遗憾随先验宽度递减,并表明层次通过关于动作数的非常数因子降低了遗憾。我们在合成与真实世界实验中从经验上证实了这些理论发现。

关键词

引用

@article{arxiv.2202.01454,
  title  = {Deep Hierarchy in Bandits},
  author = {Joey Hong and Branislav Kveton and Sumeet Katariya and Manzil Zaheer and Mohammad Ghavamzadeh},
  journal= {arXiv preprint arXiv:2202.01454},
  year   = {2022}
}