面向网络边缘最优服务放置的学习增强型索引策略
网络与互联网体系结构
2021-01-15 v2 机器学习
摘要
我们考虑网络边缘的服务放置问题,其中决策者须在 个服务中选择在边缘托管哪些服务以满足客户需求。我们的目标是设计自适应算法以最小化客户的平均服务交付时延。我们将该问题建模为一个马尔可夫决策过程(MDP),其中系统状态由描述每个服务当前在边缘等待获取该服务的客户数量给出。然而,由于维数灾难,求解此 服务 MDP 计算代价高昂。为克服该挑战,我们证明单服务 MDP 的最优策略具有吸引人的阈值结构,并基于 Whittle 索引策略理论显式推导出每个服务相对于客户请求数的 Whittle 索引。由于请求到达率与服务交付率通常未知且可能时变,我们进而开发了高效的学习增强算法,以低学习遗憾充分利用最优策略的结构。其中第一种为 UCB-Whittle,依赖于面对不确定性时的乐观原则。第二种算法 Q-learning-Whittle 通过对每个服务使用双时间尺度随机逼近的 Q-learning 迭代。我们通过分析其学习遗憾刻画了 UCB-Whittle 的非渐近性能,并分析了 Q-learning-Whittle 的收敛性质。仿真结果表明所提策略具有优异的实证性能。
引用
@article{arxiv.2101.03641,
title = {Learning Augmented Index Policy for Optimal Service Placement at the Network Edge},
author = {Guojun Xiong and Rahul Singh and Jian Li},
journal= {arXiv preprint arXiv:2101.03641},
year = {2021}
}