中文

不完美观测下 restless 多臂老虎机(RMAB)的短视策略最优性

最优化与控制 2016-02-02 v1

摘要

我们考虑关于N个项目的调度问题。每个项目演化为一个多状态马尔可夫过程。在每个时刻,调度一个项目工作,并获得依赖于所选项目状态的某种奖励。目标是设计一种调度策略,以最大化有限或无限时域上的期望累积折扣奖励。所考虑的问题可归入 restless 多臂老虎机(RMAB)问题,该问题在决策理论中具有基础重要性。众所周知,求解RMAB问题是PSPACE难的,由于计算复杂度呈指数级,最优策略通常难以处理。一个自然的替代方案是考虑易于实现的短视策略(myopic policy),其最大化即时奖励。在本文中,我们对所考虑的RMAB问题进行了分析研究,并建立了一组闭式条件以保证短视策略的最优性。

关键词

引用

@article{arxiv.1602.00195,
  title  = {Optimality of Myopic Policy for Restless Multiarmed Bandit with Imperfect Observation},
  author = {Kehao Wang},
  journal= {arXiv preprint arXiv:1602.00195},
  year   = {2016}
}

备注

11 pages, submitted for possible journal publication