最优置信UCB:有限臂老虎机的改进后悔
机器学习
2016-02-25 v3 最优化与控制
摘要
我提出了首个用于随机有限臂老虎机的算法,它同时享有阶最优的问题依赖后悔和最坏情况后悔。除了理论结果外,新算法简单、高效且在经验上极佳。该方法基于UCB,但带有一个精心选择的置信参数,该参数最优地平衡了置信区间失效的风险与过度乐观的代价。
引用
@article{arxiv.1507.07880,
title = {Optimally Confident UCB: Improved Regret for Finite-Armed Bandits},
author = {Tor Lattimore},
journal= {arXiv preprint arXiv:1507.07880},
year = {2016}
}
备注
26 pages