中文

基于 GrAPL 的图阈值老虎机

机器学习 2020-03-26 v3 机器学习

摘要

在本文中,我们引入了一种新的在线决策范式,称之为阈值图老虎机(Thresholding Graph Bandits)。主要目标是在多臂老虎机问题中高效识别出均值高于指定阈值的臂的子集。传统上此类问题假设各臂相互独立,而在我们的范式中进一步假设我们可以以图的形式获取臂之间的相似性,从而能用更少的样本获得关于臂均值的信息。此类设置在现代决策问题中起着关键作用,其中尽管每次可用选项众多,仍需快速做出决策。我们提出 GrAPL,一种用于阈值图老虎机问题的新算法。我们从理论上证明,该算法在图结构可用时能有效地利用图结构,并在奖励函数同质性(即连接紧密的臂具有相似奖励)有利时加以利用。我们在合成与真实数据上的实验证实了这些理论发现。

关键词

引用

@article{arxiv.1905.09190,
  title  = {Thresholding Graph Bandits with GrAPL},
  author = {Daniel LeJeune and Gautam Dasarathy and Richard G. Baraniuk},
  journal= {arXiv preprint arXiv:1905.09190},
  year   = {2020}
}

备注

14 pages, 3 figures. To appear in AISTATS 2020