聚集一群 Bandit 算法
机器学习
2017-06-07 v3 机器学习
摘要
我们研究组合多个 bandit 算法(即具有部分反馈的在线学习算法)的问题,目标是创建一个主算法,使其性能几乎与单独运行最佳基础算法一样好。主要挑战在于,当与主算法一起运行时,基础算法不可避免地会收到少得多的反馈,因此关键在于主算法不能让一个初始可能表现缺乏竞争力但在给予足够反馈时最终会胜过其他算法的基础算法饿死。我们通过设计一种带有特殊镜像映射的 Online Mirror Descent 版本以及复杂的步长方案来解决这一困难。我们表明,与先前的工作相比,这种方法能够在利用和探索基础算法之间实现更微妙的平衡,从而产生更优的遗憾界。我们的结果适用于多种场景,如多臂 bandit、上下文 bandit 和凸 bandit。作为示例,我们展示了两个主要应用。第一个是创建一个算法,使其在最坏情况下具有鲁棒性的同时,在环境相对容易时表现更好。第二个是创建一个算法,使其能在环境的不同假设下同时工作,如不同的先验或不同的损失结构。
引用
@article{arxiv.1612.06246,
title = {Corralling a Band of Bandit Algorithms},
author = {Alekh Agarwal and Haipeng Luo and Behnam Neyshabur and Robert E. Schapire},
journal= {arXiv preprint arXiv:1612.06246},
year = {2017}
}
备注
Accepted to COLT 2017