无限多臂老虎机中的简单后悔
机器学习
2015-05-19 v1 机器学习
摘要
我们考虑一个具有无限多臂的随机老虎机问题。在此设定下,学习者甚至没有机会将所有臂尝试一次,而必须将其有限数量的样本仅用于一定数量的臂。此前针对此设定设计的所有算法均旨在最小化学习者的累积后悔。在本文中,我们提出一种旨在最小化简单后悔的算法。如同无限多臂老虎机的累积后悔设定,简单后悔的收敛速率将依赖于一个参数 ,该参数刻画了近最优臂的分布。我们证明,根据 的不同,我们的算法要么是极小极大最优的(相差一个乘法常数),要么是极小极大最优的(相差一个 因子)。我们还提供了对几个重要情形的扩展:当 未知时、在近最优臂具有小方差的自然设定下,以及未知时间范围的情形。
引用
@article{arxiv.1505.04627,
title = {Simple regret for infinitely many armed bandits},
author = {Alexandra Carpentier and Michal Valko},
journal= {arXiv preprint arXiv:1505.04627},
year = {2015}
}
备注
in 32th International Conference on Machine Learning (ICML 2015)