中文

广义线性上下文赌博机中的延迟自适应学习

机器学习 2020-03-12 v1 机器学习

摘要

在本文中,我们考虑广义线性上下文赌博机中的在线学习,其中奖励并非立即被观测到。相反,奖励仅在经过某种未知且随机的延迟后才对决策者可用。我们研究了两种已知算法在该延迟设定下的性能:一种基于上置信界,另一种基于 Thompson 采样。我们描述了这两种算法应如何修改以适应延迟,并给出了两种算法的后悔界刻画。我们的结果通过确立这两种算法均可被改造为对延迟具有鲁棒性,从而丰富了上下文赌博机文献的广阔图景,有助于澄清并 reaffirm 这两种在现代推荐引擎中广泛部署的算法的经验性成功。

关键词

引用

@article{arxiv.2003.05174,
  title  = {Delay-Adaptive Learning in Generalized Linear Contextual Bandits},
  author = {Jose Blanchet and Renyuan Xu and Zhengyuan Zhou},
  journal= {arXiv preprint arXiv:2003.05174},
  year   = {2020}
}