中文

最优置信UCB:有限臂老虎机的改进后悔

机器学习 2016-02-25 v3 最优化与控制

摘要

我提出了首个用于随机有限臂老虎机的算法,它同时享有阶最优的问题依赖后悔和最坏情况后悔。除了理论结果外,新算法简单、高效且在经验上极佳。该方法基于UCB,但带有一个精心选择的置信参数,该参数最优地平衡了置信区间失效的风险与过度乐观的代价。

关键词

引用

@article{arxiv.1507.07880,
  title  = {Optimally Confident UCB: Improved Regret for Finite-Armed Bandits},
  author = {Tor Lattimore},
  journal= {arXiv preprint arXiv:1507.07880},
  year   = {2016}
}

备注

26 pages