机会性多臂赌博机的自适应探索-利用权衡
机器学习
2018-12-03 v2 机器学习
摘要
在本文中,我们提出并研究了机会性多臂赌博机——一种新的多臂赌博机变体,其中拉动次优臂的遗憾在不同的环境条件(如网络负载或产品价格)下会发生变化。当负载/价格较低时,拉动次优臂的成本/遗憾也较低(例如,尝试次优的网络配置)。因此,直观上,我们可以在负载/价格低时更多地探索,在负载/价格高时更多地利用。受此直觉启发,我们提出了一种自适应上置信界(AdaUCB)算法,以自适应地平衡机会性多臂赌博机的探索-利用权衡。我们证明,AdaUCB实现了的遗憾,且系数小于传统UCB算法。此外,如果负载水平低于某个阈值时探索成本为零,则AdaUCB关于实现了的遗憾。最后,基于合成数据和真实世界轨迹的实验结果表明,在负载/价格大幅波动的情况下,AdaUCB显著优于其他多臂赌博机算法,如UCB和TS(汤普森采样)。
关键词
引用
@article{arxiv.1709.04004,
title = {Adaptive Exploration-Exploitation Tradeoff for Opportunistic Bandits},
author = {Huasen Wu and Xueying Guo and Xin Liu},
journal= {arXiv preprint arXiv:1709.04004},
year = {2018}
}
备注
In Proceedings of the 35th International Conference on Machine Learning (ICML), 2018, pp. 5306-5314, Stockholmsm\"assan, Stockholm Sweden, ICML 2018. (PMLR 80:5306-5314)