中文

基于乐观加权 VDN 与并行迁移强化学习的 Wi-Fi 7 多链路操作信道选择

网络与互联网体系结构 2023-07-12 v1

摘要

密集且非规划的 IEEE 802.11 无线保真(Wi-Fi)部署,以及用户吞吐量与时延严苛业务的持续增长,使得机器学习算法被视为产业界与学术界的有前景技术。具体而言,正在制定的 IEEE 802.11be EHT——极高吞吐量,即 Wi-Fi 7——修正案首次提出了多链路操作(MLO)。其中,由于新颖的多接口提案,该新特性将增加信道选择的复杂性。本文提出一种基于并行迁移强化学习(PTRL)的协作多智能体强化学习(MARL)算法,称为并行迁移强化学习乐观加权值分解网络(oVDN),以改进 IEEE 802.11be 支持 MLO 的网络中的智能信道选择。此外,我们比较了不同并行迁移学习替代方案与集中式非迁移 MARL 基线的影响。给出两种 PTRL 方法:多智能体系统(MAS)联合 Q 函数迁移(迁移联合 Q 函数)与 MAS 最佳/最差经验迁移(在 MAS 间迁移最佳与最差经验)。仿真结果表明 oVDNg——仅利用最佳经验——是最佳算法变体。而且,与 VDN、VDN-nonQ 和非 PTRL 基线相比,oVDNg 分别带来最高 3%、7.2% 和 11% 的增益。此外,oVDNg 在 5 GHz 接口上相较 oVDNb 和 oVDN(分别仅考虑最差和两类经验)获得了 33.3% 的奖励收敛增益。最后,我们最佳的 PTRL 替代方案相较非 PTRL 基线在收敛速度上提升达 40 个回合,奖励提升达 135%。

关键词

引用

@article{arxiv.2307.05419,
  title  = {Channel Selection for Wi-Fi 7 Multi-Link Operation via Optimistic-Weighted VDN and Parallel Transfer Reinforcement Learning},
  author = {Pedro Enrique Iturria-Rivera and Marcel Chenier and Bernard Herscovici and Burak Kantarci and Melike Erol-Kantarci},
  journal= {arXiv preprint arXiv:2307.05419},
  year   = {2023}
}

备注

Accepted in IEEE PIMRC'23