中文

近 Boltzmann 探索

机器学习 2019-04-23 v2 数据结构与算法 机器学习

摘要

Boltzmann 探索在强化学习中被广泛用于在探索与利用之间提供权衡。最近,在 (Cesa-Bianchi et al., 2017) 中已经证明,纯 Boltzmann 探索从遗憾界角度来看表现不佳,即使在最简单的随机多臂老虎机 (MAB) 问题设置中也是如此。在本文中,我们展示了对 Boltzmann 探索的一种简单修改,该修改受标准加倍技巧的变体启发,在具有 KK 个臂的随机 MAB 问题中实现了 O(Klog1+αT)O(K\log^{1+\alpha} T) 的遗憾界,其中 α>0\alpha>0 是算法的一个参数。这改进了 (Cesa-Bianchi et al., 2017) 中的结果,其中受 Gumbel-softmax 技巧启发的算法实现了 O(Klog2T)O(K\log^2 T) 的遗憾界。我们还表明,在具有图结构反馈的随机 MAB 问题中,在不知道图结构的情况下,我们的算法实现了 O(β(G)log1+αT)O(\beta(G) \log^{1+\alpha} T) 的遗憾界,其中 β(G)\beta(G) 是反馈图的独立数。此外,我们在真实数据集和应用上进行了广泛的实验,涵盖了具有传统老虎机反馈和图结构反馈的多臂老虎机。在所有情况下,我们的算法表现与最先进水平相当或更好。

关键词

引用

@article{arxiv.1901.08708,
  title  = {Almost Boltzmann Exploration},
  author = {Harsh Gupta and Seo Taek Kong and R. Srikant and Weina Wang},
  journal= {arXiv preprint arXiv:1901.08708},
  year   = {2019}
}

备注

12 pages, 14 figures. Fixed a figure