中文

机会性多臂赌博机的自适应探索-利用权衡

机器学习 2018-12-03 v2 机器学习

摘要

在本文中,我们提出并研究了机会性多臂赌博机——一种新的多臂赌博机变体,其中拉动次优臂的遗憾在不同的环境条件(如网络负载或产品价格)下会发生变化。当负载/价格较低时,拉动次优臂的成本/遗憾也较低(例如,尝试次优的网络配置)。因此,直观上,我们可以在负载/价格低时更多地探索,在负载/价格高时更多地利用。受此直觉启发,我们提出了一种自适应上置信界(AdaUCB)算法,以自适应地平衡机会性多臂赌博机的探索-利用权衡。我们证明,AdaUCB实现了O(logT)O(\log T)的遗憾,且系数小于传统UCB算法。此外,如果负载水平低于某个阈值时探索成本为零,则AdaUCB关于TT实现了O(1)O(1)的遗憾。最后,基于合成数据和真实世界轨迹的实验结果表明,在负载/价格大幅波动的情况下,AdaUCB显著优于其他多臂赌博机算法,如UCB和TS(汤普森采样)。

关键词

引用

@article{arxiv.1709.04004,
  title  = {Adaptive Exploration-Exploitation Tradeoff for Opportunistic Bandits},
  author = {Huasen Wu and Xueying Guo and Xin Liu},
  journal= {arXiv preprint arXiv:1709.04004},
  year   = {2018}
}

备注

In Proceedings of the 35th International Conference on Machine Learning (ICML), 2018, pp. 5306-5314, Stockholmsm\"assan, Stockholm Sweden, ICML 2018. (PMLR 80:5306-5314)