集成接入回传网络中用于网络路由的多智能体强化学习
网络与互联网体系结构
2023-05-26 v1 人工智能
摘要
我们研究了由光纤连接和无线基站以及多个用户组成的集成接入回传(IAB)网络中的无线路由问题。这些网络的物理约束阻碍了中心控制器的使用,且基站对实时网络状况的访问有限。我们旨在最大化数据包到达率同时最小化其时延,为此,我们将该问题建模为多智能体部分可观测马尔可夫决策过程(POMDP)。为解决该问题,我们开发了关系优势 actor-critic(Relational A2C)算法,该算法利用多智能体强化学习(MARL)以及关于相似目的地的信息,以分布式方式推导联合路由策略。我们给出了该算法的三种训练范式,并证明其能达到接近集中式的性能。我们的结果表明,Relational A2C优于其他强化学习算法,提升了网络效率并减少了自私智能体行为。据我们所知,本工作是首个针对IAB网络优化路由策略的研究。
引用
@article{arxiv.2305.16170,
title = {Multi-Agent Reinforcement Learning for Network Routing in Integrated Access Backhaul Networks},
author = {Shahaf Yamin and Haim Permuter},
journal= {arXiv preprint arXiv:2305.16170},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2110.14541, arXiv:1910.04041, arXiv:1911.10635 by other authors