多智能体系统的无状态强化学习:动态信道绑定 WLAN 中频谱分配案例
网络与互联网体系结构
2021-06-11 v1
摘要
以主信道和带宽选择形式进行的频谱分配是动态信道绑定(DCB)无线局域网(WLANs)的一个关键因素。为应对网络自行改变配置的变化环境,无线领域正寻求机器学习(ML)辅助的解决方案,尤其是因其试错方法而采用的强化学习(RL)。然而,通常需做出强假设以使复杂 RL 模型收敛到近最优解。本文的目标有二:以可理解的方式论证为何 RL 应作为无线网络问题(如分散式频谱分配)的方法,并质疑在现实场景中复杂 RL 算法的使用是否有助于快速学习。我们推导出,以轻量多臂老虎机(MABs)形式出现的无状态 RL 是一种避免定义广泛或无意义 RL 状态的快速适应高效方案。
引用
@article{arxiv.2106.05553,
title = {Stateless Reinforcement Learning for Multi-Agent Systems: the Case of Spectrum Allocation in Dynamic Channel Bonding WLANs},
author = {Sergio Barrachina-Muñoz and Alessandro Chiumento and Boris Bellalta},
journal= {arXiv preprint arXiv:2106.05553},
year = {2021}
}