中文

基于仿真的马尔可夫决策过程与多动作 restless bandits 算法

系统与控制 2020-07-28 v1 机器学习 系统与控制

摘要

我们考虑多维马尔可夫决策过程,并制定了一个长期折扣奖励优化问题。研究了两种基于仿真的算法——蒙特卡洛 rollout 策略和并行 rollout 策略,并讨论了这些策略的各种性质。接下来,我们考虑一个具有多维状态空间和多动作 bandit 模型的随机多臂 bandit (RMAB)。标准的 RMAB 每个臂包含两个动作,而在多动作 RMAB 中,每个臂有超过两个动作。RMAB 的一种流行方法是基于 Whittle 指数的启发式策略。可索引性是使用基于指数策略的重要要求。基于此,RMAB 被分类为可索引或不可索引 bandits。我们的兴趣在于研究蒙特卡洛 rollout 策略在可索引和不可索引随机 bandits 中的应用。我们首先分析一个标准的可索引 RMAB(双动作模型),并讨论基于指数的策略方法。我们提出了使用蒙特卡洛 rollout 策略的近似指数计算算法。该算法的收敛性通过双时间尺度随机逼近方案得以证明。随后,我们分析了多动作可索引 RMAB,并讨论了基于指数的策略方法。我们还使用蒙特卡洛 rollout 策略研究了标准和多动作 bandit 的不可索引 RMAB。

关键词

引用

@article{arxiv.2007.12933,
  title  = {Simulation Based Algorithms for Markov Decision Processes and Multi-Action Restless Bandits},
  author = {Rahul Meshram and Kesav Kaza},
  journal= {arXiv preprint arXiv:2007.12933},
  year   = {2020}
}

备注

3 Figures