无强制探索的单峰_bandit策略
机器学习
2020-07-01 v1 信息论
math.IT
机器学习
摘要
我们考虑一个由一组具有单峰结构的 Gaussian 或 Bernoulli 分布指定的多臂 bandit 问题。尽管该问题已在文献中有所研究(Combes 和 Proutiere,2014),但针对此种结构的最先进算法都出现了强制探索机制。我们引入 IMED-UB,这是首个利用单峰结构且无需强制探索的策略,它通过将 Honda 和 Takemura(2015)提出的索引最小经验散度(IMED)策略适配到该设定下来实现。该策略被证明是最优的。随后我们推导出 KLUCB-UB,即 IMED-UB 的 KLUCB 版本,其同样被证明是最优的。得益于我们的证明技术,我们进一步能够以统一的方式对两种策略给出简洁的有限时间分析。数值实验表明,IMED-UB 和 KLUCB-UB 在实践中表现相似,且优于最先进算法。
引用
@article{arxiv.2006.16569,
title = {Forced-exploration free Strategies for Unimodal Bandits},
author = {Hassan Saber and Pierre Ménard and Odalric-Ambrym Maillard},
journal= {arXiv preprint arXiv:2006.16569},
year = {2020}
}