CORe:在赌博机探索中利用奖励
机器学习
2021-03-09 v1 机器学习
摘要
我们提出一种仅通过随机化其过往观测来进行探索的赌博机算法。具体而言,均值奖励估计中充分的乐观性是通过利用过往观测奖励中的方差来实现的。我们将该算法命名为Capitalizing On Rewards(CORe)。该算法具有通用性,可轻松应用于不同的赌博机设定。CORe的主要益处在于其探索完全依赖于数据。它不依赖任何外部噪声,并能适应不同问题而无需参数调优。我们推导了CORe在随机线性赌博机中n轮后悔的无间隙界Õ(d√(n log K)),其中d为特征数,K为臂数。在多个合成与真实世界问题上的广泛实证评估展示了CORe的有效性。
引用
@article{arxiv.2103.04387,
title = {CORe: Capitalizing On Rewards in Bandit Exploration},
author = {Nan Wang and Branislav Kveton and Maryam Karimzadehgan},
journal= {arXiv preprint arXiv:2103.04387},
year = {2021}
}