中文

机会频谱接入中的在线学习:一种休止赌博机方法

最优化与控制 2010-10-04 v1 机器学习

摘要

我们考虑一个机会频谱接入(OSA)问题,其中每个信道的时变状况(例如,由随机衰落或某些主用户活动引起)被建模为任意有限状态马尔可夫链。在每个时刻,一个(次)用户探测一个信道,并根据信道状态获得一定奖励(例如,良好的信道条件为用户带来更高的数据速率)。每个信道可能具有不同的状态空间和统计特性,这些对用户都是未知的,用户试图在学习过程中找出最佳信道并最大化其使用。目标是构建一个好的在线学习算法,以最小化用户总奖励性能与(如果用户事先知道信道统计特性从而知道最佳信道)使用最佳信道(平均)性能之间的差异(也称为遗憾值)。这是一个经典的探索与利用问题,当奖励过程假设为独立同分布时已有大量结果。与先前工作相比,最大的区别在于我们的奖励过程被假设为马尔可夫过程,独立同分布是其特例。此外,奖励过程是休止的,因为信道状况会独立于用户行为而继续演化。这导致了一个休止赌博机问题,据我们所知,在此学习背景下,关于算法或性能界的结果很少。在本文中,我们介绍了一种利用马尔可夫链再生周期并计算基于样本均值的索引策略的算法,并证明在马尔可夫链状态转移概率的温和条件下,该算法随时间均匀地实现对数遗憾值,且该遗憾值界也是最优的。

关键词

引用

@article{arxiv.1010.0056,
  title  = {Online Learning in Opportunistic Spectrum Access: A Restless Bandit Approach},
  author = {Cem Tekin and Mingyan Liu},
  journal= {arXiv preprint arXiv:1010.0056},
  year   = {2010}
}