中文

极值bandit的无遗憾界

机器学习 2016-04-12 v3 机器学习 最优化与控制 统计理论 统计理论

摘要

超参数优化算法层出不穷,这些算法在不同且往往无法验证的假设下均表现良好。受依次选择使用何种算法这一普遍挑战的推动,我们研究了在随机超参数优化中从若干分布里选择使用哪一个的更具体任务。该工作自然地被框定为极值bandit设定,其处理依次从集合中选择哪个分布进行采样,以最小化(最大化)单个最佳代价(奖励)。标准bandit设定中的分布主要由其均值刻画,而当关注最小代价而非平均代价时,会出现一些微妙之处。例如,可能不存在像标准bandit设定中那样明确定义的“最佳”分布。最佳分布取决于已获得的奖励和剩余的时域。在标准bandit设定中,将策略与播放单一最佳臂的预言机比较是合理的;而在极值bandit设定中,存在多种合理的预言机模型。我们定义了极值bandit设定中合理的“极值遗憾”概念,其与标准bandit设定中的遗憾概念平行。然后我们证明任何策略都无法渐近地实现无极值遗憾。

关键词

引用

@article{arxiv.1508.02933,
  title  = {No Regret Bound for Extreme Bandits},
  author = {Robert Nishihara and David Lopez-Paz and Léon Bottou},
  journal= {arXiv preprint arXiv:1508.02933},
  year   = {2016}
}

备注

11 pages, International Conference on Artificial Intelligence and Statistics, 2016