中文

无限多臂老虎机中的简单后悔

机器学习 2015-05-19 v1 机器学习

摘要

我们考虑一个具有无限多臂的随机老虎机问题。在此设定下,学习者甚至没有机会将所有臂尝试一次,而必须将其有限数量的样本仅用于一定数量的臂。此前针对此设定设计的所有算法均旨在最小化学习者的累积后悔。在本文中,我们提出一种旨在最小化简单后悔的算法。如同无限多臂老虎机的累积后悔设定,简单后悔的收敛速率将依赖于一个参数 β\beta,该参数刻画了近最优臂的分布。我们证明,根据 β\beta 的不同,我们的算法要么是极小极大最优的(相差一个乘法常数),要么是极小极大最优的(相差一个 log(n)\log(n) 因子)。我们还提供了对几个重要情形的扩展:当 β\beta 未知时、在近最优臂具有小方差的自然设定下,以及未知时间范围的情形。

关键词

引用

@article{arxiv.1505.04627,
  title  = {Simple regret for infinitely many armed bandits},
  author = {Alexandra Carpentier and Michal Valko},
  journal= {arXiv preprint arXiv:1505.04627},
  year   = {2015}
}

备注

in 32th International Conference on Machine Learning (ICML 2015)