线性Bandit纯探索的博弈化
机器学习
2020-07-03 v1 机器学习
摘要
我们研究了一种主动纯探索设定,包含最优臂辨识,处于线性随机bandit的背景下。尽管标准多臂bandit存在渐近最优算法,但线性bandit中最优臂辨识的此类算法的存在性一直难以捉摸,尽管已有多次尝试来解决它。首先,我们对线性情形下不同的最优性概念进行了透彻比较并给出新见解,包括G-最优性、来自最优实验设计的转导最优性以及渐近最优性。其次,我们设计了首个用于线性bandit中固定置信度纯探索的渐近最优算法。因此,我们的算法自然绕过了由一个简单但困难的实例所引起的陷阱,而大多数先前的算法不得不专门设计以显式处理该实例。最后,我们通过提供一种涉及高效实现的方法,避免了对最优设计问题的完全求解之需。
引用
@article{arxiv.2007.00953,
title = {Gamification of Pure Exploration for Linear Bandits},
author = {Rémy Degenne and Pierre Ménard and Xuedong Shang and Michal Valko},
journal= {arXiv preprint arXiv:2007.00953},
year = {2020}
}
备注
11+25 pages. To be published in the proceedings of ICML 2020