自适应多臂识别
机器学习
2017-06-06 v1
摘要
我们研究在随机 臂赌博机游戏中选择具有最高期望奖励的 个臂的问题。该问题有广泛的应用,例如 A/B 测试、众包、仿真优化。我们的目标是开发一个 PAC 算法,以至少 的概率识别出一个总遗憾至多为 的 个臂的集合。多臂识别的总遗憾概念首次在 \cite{Zhou:14} 中引入,定义为所选臂集合与最佳 个臂之间的平均期望奖励之差。与仅提供实例无关样本复杂度的 \cite{Zhou:14} 不同,我们引入了一个新的难度参数来刻画任意给定实例的难度。我们进一步开发了两种算法,并建立了基于该难度参数的相应样本复杂度。对于一大类实例,所得样本复杂度可显著小于现有最优结果,且在最坏情况下匹配实例无关下界,至多相差一个 因子。我们还证明了一个下界结果,表明对于使用所引入难度参数的实例相关算法,额外的 是必要的。
引用
@article{arxiv.1706.01026,
title = {Adaptive Multiple-Arm Identification},
author = {Jiecao Chen and Xi Chen and Qin Zhang and Yuan Zhou},
journal= {arXiv preprint arXiv:1706.01026},
year = {2017}
}
备注
30 pages, 5 figures, preliminary version to appear in ICML 2017