任意时间赌博机策略的鲁棒性
机器学习
2011-07-26 v2
摘要
本文研究了随机多臂赌博机问题中遗憾的偏差。当总游戏次数n事先为智能体所知时,Audibert等人(2009)给出了一种策略,使得以至少的概率,该策略的遗憾为阶。他们还证明了这一性质并非Auer等人(2002)流行的ucb1策略所共有。本文首先回答了一个开放问题:将这一否定结果推广到任意任意时间策略。本文的第二个贡献是针对特定的多臂赌博机问题设计了任意时间鲁棒策略,在这些问题中,对不同臂的可能分布集合施加了某些限制。
引用
@article{arxiv.1107.4506,
title = {Robustness of Anytime Bandit Policies},
author = {Antoine Salomon and Jean-Yves Audibert},
journal= {arXiv preprint arXiv:1107.4506},
year = {2011}
}