基于多智能体深度强化学习的 D2D 底层通信频谱分配
网络与互联网体系结构
2019-12-20 v1
摘要
设备到设备(D2D)通信底层蜂窝网络是一种提升频谱效率的有前景技术。在此情形下,D2D 传输可能对蜂窝链路及其他 D2D 链路造成严重干扰,这给频谱分配带来巨大技术挑战。现有集中式方案需要全局信息,导致较大信令开销。而现有分布式方案需要 D2D 用户间频繁信息交换且无法达到全局优化。本文提出一种基于多智能体深度强化分布的分布式频谱分配框架,命名为多智能体 actor critic(MAAC)。MAAC 在集中式训练期间共享全局历史状态、动作与策略,在执行期间无需信号交互,并利用用户间协作进一步优化系统性能。此外,为降低训练计算复杂度,我们进一步提出基于邻用户历史信息的邻智能体 actor critic(NAAC)用于集中式训练。仿真结果表明,所提 MAAC 与 NAAC 能有效降低蜂窝链路中断概率、大幅提升 D2D 链路和速率并快速收敛。
引用
@article{arxiv.1912.09302,
title = {Multi-Agent Deep Reinforcement Learning based Spectrum Allocation for D2D Underlay Communications},
author = {Zheng Li and Caili Guo},
journal= {arXiv preprint arXiv:1912.09302},
year = {2019}
}
备注
Accepted to IEEE Transactions on Vehicular Technology. arXiv admin note: text overlap with arXiv:1904.06615