中文

用于立方体卫星网络数据预存储与路由的分布式与分布鲁棒元强化学习(D2-RMRL)

信息论 2022-06-15 v1 math.IT

摘要

本文研究动态、资源受限的立方体卫星网络中的数据预存储与路由问题。在此网络中,每颗立方体卫星向其覆盖范围内的用户簇投递所请求的数据。一组地面网关将某些数据路由并预存至卫星,从而地面用户可直接由预存数据服务。该预存储与路由设计问题被建模为分散式马尔可夫决策过程(Dec-MDP),我们寻求使预存储命中率(即由预存数据直接服务的用户比例)最大化的最优策略。为获得最优策略,提出一种分布式分布鲁棒元强化学习(D2-RMRL)算法,其包含三个关键要素:以最小通信开销在分布式环境下实现全局最优的值分解、为在动态条件下缩短训练时间而获取最优初始化的元学习,以及进一步加速元训练过程的预训练。仿真结果表明,相较基线强化学习算法,所提值分解与元训练技术使卫星网络的预存储命中率提升 31.8%、收敛速度提升 40.7%。此外,所提预训练机制可将元学习过程缩短至多 43.7%。

关键词

引用

@article{arxiv.2206.06568,
  title  = {Distributed and Distribution-Robust Meta Reinforcement Learning (D2-RMRL) for Data Pre-storing and Routing in Cube Satellite Networks},
  author = {Ye Hu and Xiaodong Wang and Walid Saad},
  journal= {arXiv preprint arXiv:2206.06568},
  year   = {2022}
}