集中式与分布式深度强化学习方法用于下行链路和速率优化
信息论
2020-09-15 v2 math.IT
摘要
对于多小区多用户蜂窝网络,通过功率分配实现下行链路和速率最大化是一个非凸且NP难的优化问题。本文提出了一种有效的方法,通过单智能体和多智能体演员-评论家深度强化学习(DRL)来解决该问题。具体地,我们使用有限时域信任区域优化。通过大量仿真,我们表明,与加权最小均方误差(WMMSE)和分数规划(FP)等最先进优化算法相比,我们能够同时实现更高的频谱效率,同时执行速度快两个数量级以上。此外,所提出的信任区域方法在性能和收敛性方面优于优势演员-评论家(A2C) DRL算法。与先前方法相比,所提出的分布式DRL方法允许在有限CSI和基站间可控信息交换的情况下进行分布式优化,同时提供有竞争力的性能和更短的训练时间。
引用
@article{arxiv.2009.03033,
title = {Centralized & Distributed Deep Reinforcement Learning Methods for Downlink Sum-Rate Optimization},
author = {Ahmad Ali Khan and Raviraj Adve},
journal= {arXiv preprint arXiv:2009.03033},
year = {2020}
}
备注
Accepted for publication in IEEE Transactions on Wireless Communications