中文

面向边缘工业物联网中分散式强化学习的自适应随机 ADMM

机器学习 2021-07-02 v1 系统与控制 系统与控制

摘要

边缘计算通过将任务卸载到附近边缘节点,为支持工业物联网(IIoT)的实现提供了有前景的范式。同时,由于带宽有限,不断增长的网络规模使得集中式数据处理不切实际,因此分散式学习方案更受青睐。强化学习(RL)已被广泛研究,并证明是决策与最优控制过程的有前景解决方案。对于分散式设置中的 RL,通过通信网络连接的边缘节点(智能体)旨在协作寻找策略,以优化作为局部奖励之和的全局奖励。然而,在具有异构智能体的复杂环境中,通信成本、可扩展性与适应性可能显著限制分散式 RL 的性能。交替方向乘子法(ADMM)具有允许分散式实现的结构,并展现出比基于梯度下降的方法更快的收敛。因此,我们提出一种自适应随机增量 ADMM(asI-ADMM)算法,并将 asI-ADMM 应用于由边缘计算赋能的 IIoT 网络的分散式 RL。我们通过设计李雅普诺夫函数给出了所提算法的收敛性质,并证明 asI-ADMM 具有 O(1k)+O(1M)O(\frac{1}{k}) +O(\frac{1}{M}) 的收敛速率,其中 kkMM 分别为迭代次数与批量样本数。随后,我们用两个监督学习问题测试了算法。为进行性能评估,我们在具有同构与异构智能体的分散式 RL 设置中模拟了两个应用。实验结果表明,我们所提算法在通信成本与可扩展性方面优于 SOTA,并能很好地适应复杂 IoT 环境。

关键词

引用

@article{arxiv.2107.00481,
  title  = {Adaptive Stochastic ADMM for Decentralized Reinforcement Learning in Edge Industrial IoT},
  author = {Wanlu Lei and Yu Ye and Ming Xiao and Mikael Skoglund and Zhu Han},
  journal= {arXiv preprint arXiv:2107.00481},
  year   = {2021}
}