基于 Whittle 指标的常返_bandit 平均奖励 Q-learning
机器学习
2021-09-22 v3 最优化与控制
机器学习
摘要
针对具有平均奖励的多臂常返_bandit 问题,我们引入了一种新颖的强化学习算法,使用了 Q-learning 与 Whittle 指标范式。具体而言,我们利用 Whittle 指标策略的结构来缩减 Q-learning 的搜索空间,从而带来显著的计算收益。我们提供了严格的收敛性分析,并辅以数值实验支持。数值实验显示了所提方案的优异经验性能。
引用
@article{arxiv.2004.14427,
title = {Whittle index based Q-learning for restless bandits with average reward},
author = {Konstantin E. Avrachenkov and Vivek S. Borkar},
journal= {arXiv preprint arXiv:2004.14427},
year = {2021}
}