外生全局马尔可夫过程下 restless 多臂老虎机的学习
机器学习
2023-01-04 v2 信号处理
摘要
我们考虑具有未知臂动态的restless多臂老虎机(RMAB)问题的扩展,其中一个未知的外生全局马尔可夫过程支配每个臂的奖励分布。在每一全局状态下,每个臂的奖励过程依据未知的马尔可夫规则演化,且不同臂之间非一致。在每时刻,玩家从个臂中选择一个进行拉动,并从有限奖励状态集合中获得随机奖励。臂是restless的,即其局部状态不论玩家动作如何都会演化。受近期相关RMAB设定研究的启发,遗憾(regret)定义为相对于知晓问题动态且在每时刻选择最大化期望即时价值的臂的玩家的奖励损失。目标是开发一种最小化遗憾的臂选择策略。为此,我们开发了外生马尔可夫过程下学习(LEMP)算法。我们从理论上分析LEMP,并建立了遗憾的有限样本界。我们表明LEMP实现了关于时间的对数级遗憾阶。我们进一步通过数值分析LEMP,并给出支持理论发现且表明LEMP显著优于替代算法的仿真结果。
引用
@article{arxiv.2112.09484,
title = {Learning in Restless Bandits under Exogenous Global Markov Process},
author = {Tomer Gafni and Michal Yemini and Kobi Cohen},
journal= {arXiv preprint arXiv:2112.09484},
year = {2023}
}
备注
13 pages, 6 figures. arXiv admin note: text overlap with arXiv:1906.08120