中文

多臂老虎机的帕累托后悔前沿

机器学习 2015-11-03 v1

摘要

给定一个多臂老虎机问题,可能期望对某些特殊动作获得比通常更小的最坏情况后悔。我证明了这种不平衡的最坏情况后悔保证的代价相当高。具体而言,如果一个算法相对于某个动作享有最坏情况后悔 B,则必须存在另一个动作,其最坏情况后悔至少为 {\Omega}(nK/B),其中 n 为时间范围,K 为动作数量。我还在随机和对抗两种设定下给出了上界,表明该结果无法改进。对于随机情形,帕累托后悔前沿在常数因子范围内被精确刻画。

关键词

引用

@article{arxiv.1511.00048,
  title  = {The Pareto Regret Frontier for Bandits},
  author = {Tor Lattimore},
  journal= {arXiv preprint arXiv:1511.00048},
  year   = {2015}
}

备注

14 pages. To appear at NIPS 2015