多臂老虎机的帕累托后悔前沿
机器学习
2015-11-03 v1
摘要
给定一个多臂老虎机问题,可能期望对某些特殊动作获得比通常更小的最坏情况后悔。我证明了这种不平衡的最坏情况后悔保证的代价相当高。具体而言,如果一个算法相对于某个动作享有最坏情况后悔 B,则必须存在另一个动作,其最坏情况后悔至少为 {\Omega}(nK/B),其中 n 为时间范围,K 为动作数量。我还在随机和对抗两种设定下给出了上界,表明该结果无法改进。对于随机情形,帕累托后悔前沿在常数因子范围内被精确刻画。
引用
@article{arxiv.1511.00048,
title = {The Pareto Regret Frontier for Bandits},
author = {Tor Lattimore},
journal= {arXiv preprint arXiv:1511.00048},
year = {2015}
}
备注
14 pages. To appear at NIPS 2015