中文

用于近最优调度的安全学习

人工智能 2021-07-14 v2 计算机科学中的逻辑

摘要

本文研究综合、基于模型的学习与在线采样技术的结合,以获得可抢占任务调度问题的安全且近最优调度器。我们的算法可处理具有 102010^{20} 个状态及以上的马尔可夫决策过程(MDPs),这是最先进的概率模型检测工具无法处理的。我们为学习模型提供了可能近似正确(PAC)保证。此外,我们将带有建议的蒙特卡洛树搜索(基于安全博弈计算或利用最早截止时间优先调度器获得)扩展,以在所学模型上安全地进行在线探索。最后,我们在大型任务系统上实现并与屏蔽深度 Q 学习(shielded deep Q-learning)进行了实证比较。

关键词

引用

@article{arxiv.2005.09253,
  title  = {Safe Learning for Near Optimal Scheduling},
  author = {Damien Busatto-Gaston and Debraj Chakraborty and Shibashis Guha and Guillermo A. Pérez and Jean-François Raskin},
  journal= {arXiv preprint arXiv:2005.09253},
  year   = {2021}
}