通过异步多用户深度强化学习实现无线系统中的切换控制
网络与互联网体系结构
2018-05-09 v2
摘要
本文提出一种两层框架,用于在可能大规模、支持移动物联网(IoT)用户或传统蜂窝用户且用户移动模式可能异构的无线系统中学习最优切换(HO)控制器。具体而言,我们所提框架首先将具有不同移动模式的用户设备(UE)划分为簇,同一簇内移动模式相似。随后,在每个簇内开发异步多用户深度强化学习方案,以控制各簇内跨 UE 的 HO 过程,目标是降低 HO 率同时保证一定系统吞吐量。该方案中,我们使用深度神经网络(DNN)作为 HO 控制器,由各 UE 以协作方式通过强化学习习得。此外,我们在强化学习执行前利用监督学习初始化 DNN 控制器,以利用传统 HO 方案已有知识并缓解初始阶段随机探索的负面影响。进而,我们表明所采用的基于全局参数的异步框架使我们能用更多 UE 更快训练,可很好地解决支持大型系统的可扩展性问题。最后,仿真结果表明,所提框架在 HO 率方面优于最先进的在线方案。
引用
@article{arxiv.1801.02077,
title = {Handover Control in Wireless Systems via Asynchronous Multi-User Deep Reinforcement Learning},
author = {Zhi Wang and Lihua Li and Yue Xu and Hui Tian and Shuguang Cui},
journal= {arXiv preprint arXiv:1801.02077},
year = {2018}
}
备注
12 pages, 10 figures and 1 table