膨胀多臂老虎机
机器学习
2021-02-23 v3 人工智能
机器学习
摘要
在本文中,我们引入膨胀多臂老虎机(BL-MAB),这是经典随机 MAB 模型的一种新颖扩展。在 BL-MAB 模型中,可用臂的集合随时间增长(或膨胀)。与经典 MAB 设定中针对总体最优臂计算悔值不同,BL-MAB 设定中的悔值是相对于每个时刻可用的最优臂计算的。我们首先观察到,现有的随机 MAB 算法在 BL-MAB 模型上会导致线性悔值。我们证明,若最优臂在任何时刻到达的可能性均等,则无法取得次线性悔值。接下来,我们表明若最优臂更可能在早期轮次到达,则可实现次线性悔值。我们提出的算法确定了 (1) 应探索新到达臂的时间范围比例,以及 (2) 在利用阶段从已探索臂中拉取的臂序列。在对最优臂到达分布尾部薄性做出合理假设的前提下,我们证明所提算法取得了次线性、与实例无关的悔值。我们进一步量化了悔值对到达分布参数的显式依赖。我们通过大量仿真结果强化了我们的理论发现。最后我们表明,即便 (a) 分布参数并非精确已知,而是通过合理学习机制获得,或 (b) 最优臂并非更可能早期到达,而是较大比例的臂可能相对较早到达,我们的算法仍可实现次线性悔值。
引用
@article{arxiv.2001.10055,
title = {Ballooning Multi-Armed Bandits},
author = {Ganesh Ghalme and Swapnil Dhamal and Shweta Jain and Sujit Gujar and Y. Narahari},
journal= {arXiv preprint arXiv:2001.10055},
year = {2021}
}
备注
A full version of this paper is accepted in the Journal of Artificial Intelligence (AIJ) of Elsevier. A preliminary version is published as an extended abstract in AAMAS 2020. Proceedings of the 19th International Conference on Autonomous Agents and MultiAgent Systems. 2020