面向动态多信道接入的演员-评论家深度强化学习
信息论
2018-10-10 v1 机器学习
math.IT
摘要
我们考虑动态多信道接入问题,该问题可建模为部分可观测马尔可夫决策过程(POMDP)。我们首先提出一种基于无模型演员-评论家深度强化学习的框架来探索感知策略。为评估所提感知策略的性能以及该框架对不确定性的容忍度,我们在具有不同信道切换模式且考虑不同切换概率的场景中测试了该框架。接着,我们考虑时变环境以识别所提框架的自适应能力。此外,我们在平均奖励和时间效率两方面与文献[1]中提出的基于深度Q网络(DQN)的框架进行了比较。
引用
@article{arxiv.1810.03695,
title = {Actor-Critic Deep Reinforcement Learning for Dynamic Multichannel Access},
author = {Chen Zhong and Ziyang Lu and M. Cenk Gursoy and Senem Velipasalar},
journal= {arXiv preprint arXiv:1810.03695},
year = {2018}
}