基于安全强化学习的边缘计算最优流准入控制
网络与互联网体系结构
2024-07-01 v3
摘要
随着智能数据驱动应用的兴起,边缘计算基础设施需要新一代准入控制算法,以在有限且高度异构的资源下最大化系统性能。在本文中,我们研究如何最优地选择属于不同类别的信息流,并将其分发到多个边缘服务器,其中部署的应用程序执行流分析任务。通过受限马尔可夫决策过程(CMDP)理论,考虑每个边缘应用对特定类别流的需求,以及边缘服务器和接入网络计算能力的约束,我们获得了最优策略。我们开发了 DR-CPO,一种专门的原始-对偶安全强化学习(SRL)方法,该方法通过奖励分解求解由此产生的最优准入控制问题。DR-CPO 实现了最优分散控制,在保持最优性的同时有效缓解了状态空间爆炸问题。与现有的深度强化学习(DRL)解决方案相比,大量结果表明,DR-CPO 在多种环境中获得了 15% 的更高奖励,同时平均仅需 50% 的学习回合数即可收敛。最后,我们展示了如何将 DR-CPO 与负载均衡相结合,以最优地将信息流分发到可用的边缘服务器,并进一步提升系统性能。
引用
@article{arxiv.2404.05564,
title = {Optimal Flow Admission Control in Edge Computing via Safe Reinforcement Learning},
author = {A. Fox and F. De Pellegrini and F. Faticanti and E. Altman and F. Bronzino},
journal= {arXiv preprint arXiv:2404.05564},
year = {2024}
}