中文

基于随机多臂老虎机的在线实验设计综述

机器学习 2015-11-04 v4 机器学习

摘要

自适应与序贯实验设计是众多领域中研究充分的领域。我们综述并综合了称为多臂老虎机(multi-armed bandit)的在线统计学习范式的工作,将现有研究整合作为某类在线实验的资源。我们首先探讨多臂老虎机的传统随机模型,随后探讨该模型的复杂化分类方案,将每种复杂化关联到实验设计背景下的特定需求或考量。最后,在文末我们呈现了所有研究算法的已知后悔上界表格,为未来理论工作提供视角,并为寻求理论保证的从业者提供决策工具。

关键词

引用

@article{arxiv.1510.00757,
  title  = {A Survey of Online Experiment Design with the Stochastic Multi-Armed Bandit},
  author = {Giuseppe Burtini and Jason Loeppky and Ramon Lawrence},
  journal= {arXiv preprint arXiv:1510.00757},
  year   = {2015}
}

备注

49 pages, 1 figure