具有增强UCB的阈值赌博机
机器学习
2019-06-11 v3
摘要
在本文中,我们针对阈值赌博机问题(TBP)的固定预算版本提出了增强UCB (AugUCB)算法,其目标是识别出质量高于阈值的臂集合。AugUCB的一个关键特征是它同时使用均值和方差估计来消除已被充分探索的臂;据我们所知,这是首个针对所考虑TBP采用此种方法的算法。理论上,我们获得了AugUCB所产生损失(误分类概率)的上界。尽管文献中的UCBEV提供了更好的保证,但必须强调UCBEV可获取问题复杂度(其计算需要臂的均值和方差),因此在实践中并不现实;这与AugUCB形成对比,后者的实现不需要任何此类复杂度输入。我们进行了广泛的仿真实验来验证AugUCB的性能。通过仿真工作,我们确定AugUCB由于其对方差估计的利用,表现显著优于最先进的APT、CSAR和其他非基于方差的算法。
引用
@article{arxiv.1704.02281,
title = {Thresholding Bandits with Augmented UCB},
author = {Subhojyoti Mukherjee and K. P. Naveen and Nandan Sudarsanam and Balaraman Ravindran},
journal= {arXiv preprint arXiv:1704.02281},
year = {2019}
}
备注
7 pages, Accepted at Proceedings of the 26th International Joint Conference on Artificial Intelligence, 2017, 2515-2521