中文

用于无线网络中动态多信道接入的深度强化学习

网络与互联网体系结构 2018-02-21 v1

摘要

我们考虑一个动态多信道接入问题,其中多个相关信道遵循未知的联合马尔可夫模型。用户在每一个时隙选择一条信道传输数据,并基于传输成功或失败获得奖励。目标是找到一种最大化期望长期奖励的策略。该问题被公式化为具有未知系统动态的部分可观测马尔可夫决策过程(POMDP)。为克服未知系统动态以及计算量过大的挑战,我们应用强化学习概念并实现了一个深度 Q 网络(DQN),其可在无任何系统动态先验知识的情况下处理大状态空间。我们对已知系统动态下固定模式信道切换的最优策略进行了分析研究,并通过仿真表明 DQN 在不知晓系统统计特性时可达到相同的最优性能。我们通过仿真以及真实数据轨迹将 DQN 的性能与 Myopic 策略和基于 Whittle 指数的启发式方法进行比较,表明 DQN 在更复杂情形下可达到近最优性能。最后,我们提出了一种自适应 DQN 方法,具备在时变动态场景中自适应学习的能力。

关键词

引用

@article{arxiv.1802.06958,
  title  = {Deep Reinforcement Learning for Dynamic Multichannel Access in Wireless Networks},
  author = {Shangxing Wang and Hanpeng Liu and Pedro Henrique Gomes and Bhaskar Krishnamachari},
  journal= {arXiv preprint arXiv:1802.06958},
  year   = {2018}
}