基于多智能体深度强化学习的 D2D 通信频谱分配框架
网络与互联网体系结构
2019-12-18 v3
摘要
设备到设备(D2D)通信已被认为是提高频谱效率的一种有前景的技术。然而,作为底层运行的 D2D 传输会引起严重干扰,这给频谱分配带来了技术挑战。现有的集中式方案需要全局信息,可能导致严重的信令开销。而现有的分布式方案需要用户间频繁的信息交换,且无法实现全局优化。本文提出一种基于多智能体深度强化学习的分布式频谱分配框架,称为邻居智能体演员评论家(NAAC)。NAAC 利用邻居用户的历史信息进行集中训练,但以分布式方式执行而无需该信息,这不仅在执行期间无信号交互,还利用用户间协作进一步优化系统性能。仿真结果表明,所提框架能有效降低蜂窝链路的中断概率,提高 D2D 链路的和速率,并具有良好的收敛性。
引用
@article{arxiv.1904.06615,
title = {A Multi-Agent Deep Reinforcement Learning based Spectrum Allocation Framework for D2D Communications},
author = {Zheng Li and Caili Guo and Yidi Xuan},
journal= {arXiv preprint arXiv:1904.06615},
year = {2019}
}
备注
Accepted to Globecom 2019