中文

无强制探索的单峰_bandit策略

机器学习 2020-07-01 v1 信息论 math.IT 机器学习

摘要

我们考虑一个由一组具有单峰结构的 Gaussian 或 Bernoulli 分布指定的多臂 bandit 问题。尽管该问题已在文献中有所研究(Combes 和 Proutiere,2014),但针对此种结构的最先进算法都出现了强制探索机制。我们引入 IMED-UB,这是首个利用单峰结构且无需强制探索的策略,它通过将 Honda 和 Takemura(2015)提出的索引最小经验散度(IMED)策略适配到该设定下来实现。该策略被证明是最优的。随后我们推导出 KLUCB-UB,即 IMED-UB 的 KLUCB 版本,其同样被证明是最优的。得益于我们的证明技术,我们进一步能够以统一的方式对两种策略给出简洁的有限时间分析。数值实验表明,IMED-UB 和 KLUCB-UB 在实践中表现相似,且优于最先进算法。

关键词

引用

@article{arxiv.2006.16569,
  title  = {Forced-exploration free Strategies for Unimodal Bandits},
  author = {Hassan Saber and Pierre Ménard and Odalric-Ambrym Maillard},
  journal= {arXiv preprint arXiv:2006.16569},
  year   = {2020}
}