中文

用于分布式卫星路由的持续深度强化学习

机器学习 2024-05-22 v1 信息论 math.IT

摘要

本文提出了一种基于持续深度强化学习的低轨卫星星座分布式路由完整解决方案。这需要解决多个挑战,包括卫星的局部知识和持续运动,以及系统中随时间变化的的不确定性来源,如流量、通信链路或通信缓冲区。我们采用多智能体方法,每个卫星作为独立的决策智能体,同时基于从附近智能体接收的反馈获取有限的环境知识。该解决方案分为两个阶段。首先,离线学习阶段依赖于分散决策和使用全局经验训练的全局深度神经网络。然后,在线阶段使用本地、机载和预训练的DNN,需要持续学习以与环境共同演化,这可以通过两种不同方式实现:(1)模型预测,其中利用星座的可预测条件,每个卫星与下一个卫星共享本地模型;(2)联邦学习,其中每个智能体的模型首先在集群级别合并,然后在全局参数服务器中聚合。结果表明,在没有高拥塞的情况下,所提出的多智能体DRL框架实现了与最短路径解决方案相同的端到端性能,但后者假设在中心节点处进行实时网络范围知识的大量通信开销,而我们的方案仅需要在第一邻居卫星之间交换有限的反馈。重要的是,我们的解决方案很好地适应了拥塞条件,并利用了负载较轻的路径。此外,模型随时间的发散通过预测(用于短期对齐)和联邦学习(用于长期对齐)的协同作用轻松解决。

关键词

引用

@article{arxiv.2405.12308,
  title  = {Continual Deep Reinforcement Learning for Decentralized Satellite Routing},
  author = {Federico Lozano-Cuadra and Beatriz Soret and Israel Leyva-Mayorga and Petar Popovski},
  journal= {arXiv preprint arXiv:2405.12308},
  year   = {2024}
}

备注

30 pages, 11 figures