用于近最优调度的安全学习
人工智能
2021-07-14 v2 计算机科学中的逻辑
摘要
本文研究综合、基于模型的学习与在线采样技术的结合,以获得可抢占任务调度问题的安全且近最优调度器。我们的算法可处理具有 个状态及以上的马尔可夫决策过程(MDPs),这是最先进的概率模型检测工具无法处理的。我们为学习模型提供了可能近似正确(PAC)保证。此外,我们将带有建议的蒙特卡洛树搜索(基于安全博弈计算或利用最早截止时间优先调度器获得)扩展,以在所学模型上安全地进行在线探索。最后,我们在大型任务系统上实现并与屏蔽深度 Q 学习(shielded deep Q-learning)进行了实证比较。
引用
@article{arxiv.2005.09253,
title = {Safe Learning for Near Optimal Scheduling},
author = {Damien Busatto-Gaston and Debraj Chakraborty and Shibashis Guha and Guillermo A. Pérez and Jean-François Raskin},
journal= {arXiv preprint arXiv:2005.09253},
year = {2021}
}