中文

通过奖励偏置进行探索:随机多臂老虎机的奖励偏置最大似然估计

机器学习 2020-10-26 v3 机器学习

摘要

受自适应控制的奖励偏置最大似然估计方法启发,我们提出 RBMLE——一类用于随机多臂老虎机(SMABs)的新型学习算法。对于广泛的 SMABs,包括参数化指数族以及非参数次高斯/指数族,我们证明 RBMLE 产生一种索引策略。为选择 RBMLE 中的偏置增长率 α(t)\alpha(t),我们揭示了 α(t)\alpha(t) 与遗憾界之间非平凡的相互作用,该作用普遍适用于指数族以及次高斯/指数族老虎机。为量化有限时间性能,我们证明 RBMLE 通过自适应估计高斯与次高斯老虎机中 α(t)\alpha(t) 表达式的未知常数达到阶最优性。大量实验表明,所提 RBMLE 取得了与 SOTA 方法相竞争的实证遗憾性能,同时相较于其中表现最佳的方法更具计算效率与可扩展性。

关键词

引用

@article{arxiv.1907.01287,
  title  = {Exploration Through Reward Biasing: Reward-Biased Maximum Likelihood Estimation for Stochastic Multi-Armed Bandits},
  author = {Xi Liu and Ping-Chun Hsieh and Anirban Bhattacharya and P. R. Kumar},
  journal= {arXiv preprint arXiv:1907.01287},
  year   = {2020}
}

备注

ICML 2020