空天地一体化网络中面向时延的物联网任务调度的深度强化学习
机器学习
2020-10-06 v1 信号处理
摘要
本文研究空天地一体化网络(SAGIN)中面向时延的物联网(IoT)服务的计算任务调度问题。在所考虑场景中,无人机(UAV)从 IoT 设备收集计算任务并作出在线卸载决策,任务可在 UAV 处处理或卸载至附近基站或远程卫星。我们的目标是在 UAV 能量容量约束下设计最小化所有任务卸载与计算时延的任务调度策略。为此,我们首先将在线调度问题建模为能量约束的马尔可夫决策过程(MDP)。进而,考虑任务到达动态性,我们开发了一种新颖的深度风险敏感强化学习算法。具体而言,该算法评估各状态的风险(衡量超出约束的能量消耗)并搜索权衡时延与风险最小化的最优参数,同时学习最优策略。大量仿真结果表明,所提算法在满足 UAV 能量容量约束下,相较概率配置方法可将任务处理时延降低至多 30%。
引用
@article{arxiv.2010.01471,
title = {Deep Reinforcement Learning for Delay-Oriented IoT Task Scheduling in Space-Air-Ground Integrated Network},
author = {Conghao Zhou and Wen Wu and Hongli He and Peng Yang and Feng Lyu and Nan Cheng and Xuemin and Shen},
journal= {arXiv preprint arXiv:2010.01471},
year = {2020}
}
备注
14 pages, 8 figures