用于求解非平稳Bandit问题的能量正则化RNNs
机器学习
2023-03-29 v2
摘要
我们考虑一种多臂Bandit问题,其中奖励是非平稳的,且依赖于过去动作并可能依赖于过去上下文。在我们方法的核心,我们采用循环神经网络来对这些序列建模。为平衡探索与利用,我们提出一个能量最小化项,防止神经网络对某一特定动作过于自信。该项正确限制了网络所分配的最大与最小概率之间的差距。在一系列多样化实验中,我们证明我们的方法至少与针对衰减Bandit(Rotting Bandits)子问题所提出的方法同样有效,并且能求解各类基准问题的直观扩展。我们的实现已分享于 https://github.com/rotmanmi/Energy-Regularized-RNN。
引用
@article{arxiv.2303.06552,
title = {Energy Regularized RNNs for Solving Non-Stationary Bandit Problems},
author = {Michael Rotman and Lior Wolf},
journal= {arXiv preprint arXiv:2303.06552},
year = {2023}
}