结构化随机多臂老虎机中的极小探索
机器学习
2017-11-02 v1 人工智能
机器学习
最优化与控制
摘要
本文引入并解决一类广泛的随机多臂老虎机问题,其中将臂映射到相应收益的函数展现出某些已知结构特性。大多数现有结构(如线性、Lipschitz、单峰、组合、对决……)均被我们的框架涵盖。我们推导了这些问题的一个渐近实例相关后悔下界,并开发了OSSB算法,其后悔与该基本极限匹配。OSSB不基于“面对不确定性保持乐观”的经典原则或Thompson采样,而是旨在匹配在后悔下界推导中所刻画的次优臂的极小探索率。我们在线性多臂老虎机问题中通过数值实验展示了OSSB的效率,表明OSSB优于包括Thompson采样在内的现有算法。
引用
@article{arxiv.1711.00400,
title = {Minimal Exploration in Structured Stochastic Bandits},
author = {Richard Combes and Stefan Magureanu and Alexandre Proutiere},
journal= {arXiv preprint arXiv:1711.00400},
year = {2017}
}
备注
13 pages, NIPS 2017