中文

基于屏蔽强化学习的边缘计算网络上深度学习模型分布式训练

分布式、并行与集群计算 2022-06-03 v1

摘要

具备本地计算能力的边缘设备使得边缘上的分布式深度学习训练成为可能。在该方法中,一个边缘集群的簇头调度来自各边缘的深度学习训练任务。使用这种集中式调度方法,簇头知晓所有边缘的负载,从而可避免集群边缘过载,但簇头自身可能成为过载瓶颈。为处理该问题,我们提出了一种多智能体强化学习(MARL)系统,使每个边缘能够利用RL调度自身任务。然而,边缘间缺乏协调可能导致动作冲突,即多个边缘将任务调度至同一边缘并使其过载。为此,我们提出了一种称为基于屏蔽强化学习(RL)的边缘端深度学习训练(SROLE)的系统。在SROLE中,部署于边缘的屏蔽器检查动作冲突并提供替代动作以避免冲突。由于整个集群的中央屏蔽器可能成为瓶颈,我们进一步提出一种去中心化屏蔽方法,其中不同屏蔽器负责集群中的不同区域并相互协调以避免区域边界上的动作冲突。我们的仿真与真实设备实验表明,相较于MARL与集中式RL,SROLE将训练时间减少了59%。

关键词

引用

@article{arxiv.2206.00774,
  title  = {Distributed Training for Deep Learning Models On An Edge Computing Network Using ShieldedReinforcement Learning},
  author = {Tanmoy Sen and Haiying Shen},
  journal= {arXiv preprint arXiv:2206.00774},
  year   = {2022}
}

备注

Accepted in 2022 International Conference on Distributed Computing Systems (ICDCS)