基于深度强化学习的多卫星波束跳变与功率分配
系统与控制
2025-01-07 v1 系统与控制
摘要
在非地球静止轨道(NGSO)卫星通信系统中,有效利用波束跳变(BH)技术对于应对不均匀的业务需求至关重要。然而,在多 NGSO BH 场景中优化波束调度与资源分配仍是一项重大挑战。本文提出了一种基于深度强化学习(DRL)的多 NGSO BH 算法,以优化波束照射模式和功率分配。该算法利用时间、空间和功率三个自由度,旨在优化长期吞吐量和长期累积平均时延(LTCAD)。该方案基于近端策略优化(PPO),采用结合离散与连续动作的混合动作空间。通过使用具有共享基础层的两个策略网络,所提算法联合优化波束调度与功率分配。其中一个网络在离散动作空间中选择波束照射模式,另一个网络在连续空间中管理功率分配。仿真结果表明,所提算法在时变业务场景下显著降低了 LTCAD,同时保持了高吞吐量。与四种基准方法相比,网络吞吐量最高提升 ,LTCAD 最高降低 。
引用
@article{arxiv.2501.02309,
title = {Multi-Satellite Beam Hopping and Power Allocation Using Deep Reinforcement Learning},
author = {Xia Xie and Kexin Fan and Wenfeng Deng and Nikolaos Pappas and Qinyu Zhang},
journal= {arXiv preprint arXiv:2501.02309},
year = {2025}
}