极端多臂老虎机的高效算法
机器学习
2022-03-22 v1
摘要
本文针对极端老虎机(Extreme Bandit)问题做出贡献,该问题是多臂老虎机(Multi-Armed Bandits)的一种变体,其中学习者的目标是获取尽可能大的奖励。我们首先在关于奖励分布尾部的温和假设下,研究了独立同分布随机变量最大值的浓度性质。该分析启发了最大值分位数(QoMax)的引入。QoMax 的性质足以构建一个探索后提交(ETC)策略,即 QoMax-ETC,尽管简单却具有强渐近保证。我们随后提出并分析了一种更具适应性、 anytime 的算法 QoMax-SDA,它将 QoMax 与 Baudry 等人(2021)近期提出的子采样方法相结合。两种算法在两方面优于现有方法:(1)带来更好的经验性能;(2)显著降低了内存与时间复杂度。
引用
@article{arxiv.2203.10883,
title = {Efficient Algorithms for Extreme Bandits},
author = {Dorian Baudry and Yoan Russac and Emilie Kaufmann},
journal= {arXiv preprint arXiv:2203.10883},
year = {2022}
}
备注
Proceedings of the 25 th International Conference on Artificial Intelligence and Statistics (AISTATS) 2022