不完美观测下 restless 多臂老虎机(RMAB)的短视策略最优性
最优化与控制
2016-02-02 v1
摘要
我们考虑关于N个项目的调度问题。每个项目演化为一个多状态马尔可夫过程。在每个时刻,调度一个项目工作,并获得依赖于所选项目状态的某种奖励。目标是设计一种调度策略,以最大化有限或无限时域上的期望累积折扣奖励。所考虑的问题可归入 restless 多臂老虎机(RMAB)问题,该问题在决策理论中具有基础重要性。众所周知,求解RMAB问题是PSPACE难的,由于计算复杂度呈指数级,最优策略通常难以处理。一个自然的替代方案是考虑易于实现的短视策略(myopic policy),其最大化即时奖励。在本文中,我们对所考虑的RMAB问题进行了分析研究,并建立了一组闭式条件以保证短视策略的最优性。
引用
@article{arxiv.1602.00195,
title = {Optimality of Myopic Policy for Restless Multiarmed Bandit with Imperfect Observation},
author = {Kehao Wang},
journal= {arXiv preprint arXiv:1602.00195},
year = {2016}
}
备注
11 pages, submitted for possible journal publication