中文

多智能体系统的无状态强化学习:动态信道绑定 WLAN 中频谱分配案例

网络与互联网体系结构 2021-06-11 v1

摘要

以主信道和带宽选择形式进行的频谱分配是动态信道绑定(DCB)无线局域网(WLANs)的一个关键因素。为应对网络自行改变配置的变化环境,无线领域正寻求机器学习(ML)辅助的解决方案,尤其是因其试错方法而采用的强化学习(RL)。然而,通常需做出强假设以使复杂 RL 模型收敛到近最优解。本文的目标有二:以可理解的方式论证为何 RL 应作为无线网络问题(如分散式频谱分配)的方法,并质疑在现实场景中复杂 RL 算法的使用是否有助于快速学习。我们推导出,以轻量多臂老虎机(MABs)形式出现的无状态 RL 是一种避免定义广泛或无意义 RL 状态的快速适应高效方案。

关键词

引用

@article{arxiv.2106.05553,
  title  = {Stateless Reinforcement Learning for Multi-Agent Systems: the Case of Spectrum Allocation in Dynamic Channel Bonding WLANs},
  author = {Sergio Barrachina-Muñoz and Alessandro Chiumento and Boris Bellalta},
  journal= {arXiv preprint arXiv:2106.05553},
  year   = {2021}
}