近 Boltzmann 探索
机器学习
2019-04-23 v2 数据结构与算法
机器学习
摘要
Boltzmann 探索在强化学习中被广泛用于在探索与利用之间提供权衡。最近,在 (Cesa-Bianchi et al., 2017) 中已经证明,纯 Boltzmann 探索从遗憾界角度来看表现不佳,即使在最简单的随机多臂老虎机 (MAB) 问题设置中也是如此。在本文中,我们展示了对 Boltzmann 探索的一种简单修改,该修改受标准加倍技巧的变体启发,在具有 个臂的随机 MAB 问题中实现了 的遗憾界,其中 是算法的一个参数。这改进了 (Cesa-Bianchi et al., 2017) 中的结果,其中受 Gumbel-softmax 技巧启发的算法实现了 的遗憾界。我们还表明,在具有图结构反馈的随机 MAB 问题中,在不知道图结构的情况下,我们的算法实现了 的遗憾界,其中 是反馈图的独立数。此外,我们在真实数据集和应用上进行了广泛的实验,涵盖了具有传统老虎机反馈和图结构反馈的多臂老虎机。在所有情况下,我们的算法表现与最先进水平相当或更好。
关键词
引用
@article{arxiv.1901.08708,
title = {Almost Boltzmann Exploration},
author = {Harsh Gupta and Seo Taek Kong and R. Srikant and Weina Wang},
journal= {arXiv preprint arXiv:1901.08708},
year = {2019}
}
备注
12 pages, 14 figures. Fixed a figure