中文

外生全局马尔可夫过程下的 restless 多臂老虎机问题

机器学习 2022-10-11 v2 信号处理

摘要

我们考虑一类带有未知臂动态特性的 restless 多臂老虎机(RMAB)问题的扩展,其中一个未知的外生全局马尔可夫过程支配着每个臂的奖励分布。在每个全局状态下,每个臂的奖励过程依据未知的马尔可夫规则演化,且不同臂之间的规则互不相同。在每一时刻,玩家从 N 个臂中选择一个进行拉动,并从有限的奖励状态集合中收到随机奖励。臂是 restless 的,即无论玩家采取何种动作,其局部状态都会演化。受近期相关 RMAB 设定研究的启发,遗憾被定义为相对于已知问题动态特性并在每时刻 t 选择最大化期望即时价值的玩家所损失的奖励。目标是开发一种最小化遗憾的臂选择策略。为此,我们提出了外生马尔可夫过程下的学习(LEMP)算法。我们从理论上分析了 LEMP,并建立了遗憾的有限样本界。我们证明 LEMP 随时间实现了对数级的遗憾阶。我们进一步通过数值分析 LEMP,并给出支持理论发现且表明 LEMP 显著优于其他对比算法的仿真结果。

关键词

引用

@article{arxiv.2202.13665,
  title  = {Restless Multi-Armed Bandits under Exogenous Global Markov Process},
  author = {Tomer Gafni and Michal Yemini and Kobi Cohen},
  journal= {arXiv preprint arXiv:2202.13665},
  year   = {2022}
}

备注

Accepted for presentation at IEEE ICASSP 2022. arXiv admin note: substantial text overlap with arXiv:2112.09484