认知无人机网络中联合协作频谱感知与信道接入的多智能体强化学习
网络与互联网体系结构
2022-02-24 v3
摘要
本文研究覆盖于主信道之上的认知无线电无人机(CUAVs)的分布式频谱/信道接入问题。在协作频谱感知与机会式传输框架下,构建了以最大化多个CUAVs期望累积加权奖励为目标的信道分配一次性优化问题。为处理因缺乏主用户活动先验知识以及缺乏信道接入协调器所带来的不确定性,将原问题转化为马尔可夫博弈(MG)框架下的竞争与合作混合多智能体强化学习(CCH-MARL)问题。随后,将每个CUAV视为独立学习者(IL),提出了一种基于值迭代、具有上置信界-Hoeffding(UCB-H)策略搜索的强化学习算法。为缓解维数灾难,进一步将UCB-H策略扩展为双深度Q网络(DDQN)。数值仿真表明,所提算法能高效收敛至稳定策略,且相较于朴素Q学习和DDQN等基准算法显著提升了网络性能。
引用
@article{arxiv.2103.08181,
title = {Multi-Agent Reinforcement Learning for Joint Cooperative Spectrum Sensing and Channel Access in Cognitive UAV Networks},
author = {Weiheng Jiang and Wanxin Yu and Wenbo Wang and Tiancong Huang},
journal= {arXiv preprint arXiv:2103.08181},
year = {2022}
}