中文

非独立同分布臂和不完美检测下Restless Multi-armed Bandit问题中近视策略的最优性

系统与控制 2015-06-05 v2 计算机科学与博弈论

摘要

我们考虑多信道机会通信系统中的信道接入问题,其中信道感知不完美,每个信道的状态演化为非独立同分布的马尔可夫过程。该问题可归结为一种restless multi-armed bandit (RMAB) 问题,由于其指数计算复杂度而难以处理。一个自然的替代方案是考虑易于实现的近视策略(myopic policy),该策略最大化即时奖励但忽略当前策略对未来奖励的影响。特别地,我们提出了三个公理,刻画了一族称为gg-正则函数的通用且实际重要的函数,其中包括工程中广泛的效用函数。通过基于这些公理的数学分析,我们建立了一组闭式结构条件,用于近视策略的最优性。

关键词

引用

@article{arxiv.1205.5375,
  title  = {On Optimality of Myopic Policy for Restless Multi-armed Bandit Problem with Non i.i.d. Arms and Imperfect Detection},
  author = {Kehao Wang and Lin Chen and Quan Liu and Khaldoun Al Agha},
  journal= {arXiv preprint arXiv:1205.5375},
  year   = {2015}
}

备注

Second version, 16 pages