中文

机会信道接入中贪婪感知最优性的充分条件:一个统一框架

信息论 2013-09-17 v1 math.IT

摘要

本文考虑了一个源于多信道系统中机会频谱接入 (OSA) 且被广泛研究的随机控制问题,旨在提供一个统一的分析框架,使得许多先前的结果可被视为其特例。具体而言,我们考虑一个拥有 NN 个信道接入权的单无线收发器/用户,每个信道被建模为独立同分布的离散时间两状态马尔可夫链。在每个时间步,用户允许感知 kNk\leq N 个信道,随后从那些被感知为可用的信道中使用最多 mkm\leq k 个。假设信道感知是完美的,且用户在每个时间步每使用一个信道即可获得单位奖励。用户的目标是最大化其在有限或无限时域内的总折扣奖励或平均奖励。该问题此前已在各种特例中得到研究,包括 k=1k=1m=kNm=k\leq N,通常被表述为 restless bandit 问题;当两状态马尔可夫链模型呈正相关时,已推导出针对寻求最大化即时单步奖励的贪婪策略 (myopic policy) 的最优性结果。在本文中,我们研究了 1mkN1\leq m\leq k\leq N 的一般性问题,并分别推导了使得贪婪策略在有限和无限时域奖励准则下最优的充分条件。结果表明,这些结果在相应的特例下可归约为先前研究中推导出的结果,因此可被视为一组统一的最优性条件。文中还给出了数值示例,以强调在存在额外探索机会(即 m<km<k)时,最优策略为何及如何偏离原本最优的贪婪感知。

关键词

引用

@article{arxiv.1309.3692,
  title  = {Sufficient Conditions on the Optimality of Myopic Sensing in Opportunistic Channel Access: A Unifying Framework},
  author = {Yang Liu and Mingyan Liu and Sahand Haji Ali Ahmad},
  journal= {arXiv preprint arXiv:1309.3692},
  year   = {2013}
}