中文

线性Bandit纯探索的博弈化

机器学习 2020-07-03 v1 机器学习

摘要

我们研究了一种主动纯探索设定,包含最优臂辨识,处于线性随机bandit的背景下。尽管标准多臂bandit存在渐近最优算法,但线性bandit中最优臂辨识的此类算法的存在性一直难以捉摸,尽管已有多次尝试来解决它。首先,我们对线性情形下不同的最优性概念进行了透彻比较并给出新见解,包括G-最优性、来自最优实验设计的转导最优性以及渐近最优性。其次,我们设计了首个用于线性bandit中固定置信度纯探索的渐近最优算法。因此,我们的算法自然绕过了由一个简单但困难的实例所引起的陷阱,而大多数先前的算法不得不专门设计以显式处理该实例。最后,我们通过提供一种涉及高效实现的方法,避免了对最优设计问题的完全求解之需。

关键词

引用

@article{arxiv.2007.00953,
  title  = {Gamification of Pure Exploration for Linear Bandits},
  author = {Rémy Degenne and Pierre Ménard and Xuedong Shang and Michal Valko},
  journal= {arXiv preprint arXiv:2007.00953},
  year   = {2020}
}

备注

11+25 pages. To be published in the proceedings of ICML 2020