通过奖励偏置进行探索:随机多臂老虎机的奖励偏置最大似然估计
机器学习
2020-10-26 v3 机器学习
摘要
受自适应控制的奖励偏置最大似然估计方法启发,我们提出 RBMLE——一类用于随机多臂老虎机(SMABs)的新型学习算法。对于广泛的 SMABs,包括参数化指数族以及非参数次高斯/指数族,我们证明 RBMLE 产生一种索引策略。为选择 RBMLE 中的偏置增长率 ,我们揭示了 与遗憾界之间非平凡的相互作用,该作用普遍适用于指数族以及次高斯/指数族老虎机。为量化有限时间性能,我们证明 RBMLE 通过自适应估计高斯与次高斯老虎机中 表达式的未知常数达到阶最优性。大量实验表明,所提 RBMLE 取得了与 SOTA 方法相竞争的实证遗憾性能,同时相较于其中表现最佳的方法更具计算效率与可扩展性。
引用
@article{arxiv.1907.01287,
title = {Exploration Through Reward Biasing: Reward-Biased Maximum Likelihood Estimation for Stochastic Multi-Armed Bandits},
author = {Xi Liu and Ping-Chun Hsieh and Anirban Bhattacharya and P. R. Kumar},
journal= {arXiv preprint arXiv:1907.01287},
year = {2020}
}
备注
ICML 2020