中文

基于马尔可夫决策过程与 Q-Learning 的 LTE-A 网络资源分配简单强化学习机制

人工智能 2017-09-28 v1 网络与互联网体系结构

摘要

资源分配仍是无线网络中难以处理的问题。不稳定的信道条件与服务质量 (QoS) 的流量需求引发了一些干扰该过程的障碍。一项最优策略在考虑频谱效率及其他相关信道问题的同时,兼顾每个流量等级可用的资源,这是非常重要的。强化学习是一种动态且有效的方法,能够支持在为应用维持 QoS 水平的同时妥善完成资源分配。该技术能够将系统状态作为反馈进行跟踪,以提升给定任务的性能。本文提出了一种引入 LTE-A 网络的简单强化学习机制,旨在调度过程中的每个传输时间间隔 (TTI) 内,根据 QoS 等级标识符 (QCI) 选择并限制为每个流量等级分配的资源数量。所提机制实现了由 Q-Learning 算法求解的马尔可夫决策过程 (MDP),以寻找最优的动作-状态决策策略。仿真获得的结果表现出良好的性能,尤其是对于实时 Video 应用。

关键词

引用

@article{arxiv.1709.09312,
  title  = {A Simple Reinforcement Learning Mechanism for Resource Allocation in LTE-A Networks with Markov Decision Process and Q-Learning},
  author = {Einar Cesar Santos},
  journal= {arXiv preprint arXiv:1709.09312},
  year   = {2017}
}

备注

6 pages, 11 figures and 1 table