面向一般臂储库的无限臂老虎机纯探索问题
机器学习
2019-01-15 v2 机器学习
摘要
本文考虑一种多臂老虎机博弈,其中臂的数量远大于最大预算且实际上为无限。我们刻画了算法以至少 1 - {\delta} 的概率返回一个 {\epsilon}-好臂所需总预算的必要与充分条件。在此情形下,样本复杂度依赖于 {\epsilon}、{\delta} 以及所谓的储库分布 {\nu}(各臂均值从中独立同分布抽取)。尽管已有大量文献围绕 {\nu} 的特定情形(如 beta 分布)展开分析,我们的分析不对 {\nu} 的形式作任何假设。我们的算法基于连续减半(successive halving),其出人意料之处在于臂在仅被抽取一次后便开始被丢弃,这要求一种超越集中不等式的分析。该算法可证明的正确性也解释了 Li 等(2017)用于超参数调优的 Hyperband 算法中最激进的分支几乎总是最优的这一经验观察。
引用
@article{arxiv.1811.06149,
title = {Pure-Exploration for Infinite-Armed Bandits with General Arm Reservoirs},
author = {Maryam Aziz and Kevin Jamieson and Javed Aslam},
journal= {arXiv preprint arXiv:1811.06149},
year = {2019}
}
备注
We found an irrecoverable error in one of the proofs