中文

面向变长队列多目标调度的分层深度强化学习方法

机器学习 2020-07-21 v1 密码学与安全 机器学习

摘要

多目标任务调度(MOTS)是在优化多个且可能相互冲突的约束条件下进行的任务调度。当每个单独任务本身就是一个多目标优化问题时,该问题出现了一个具有挑战性的扩展。尽管深度强化学习(DRL)已成功应用于复杂序列问题,但其在 MOTS 领域的应用受到两个挑战的阻碍。第一个挑战是 DRL 算法无法确保每一项无论其在队列中的位置如何都被相同地处理。第二个挑战是需要管理大型队列,这导致庞大的神经网络架构和漫长的训练时间。在本研究中,我们提出 MERLIN,一种鲁棒、模块化且近最优的基于 DRL 的 MOTS 方法。MERLIN 对 MOTS 问题采用分层方法,构建一个用于处理单个任务的神经网络和另一个用于整体队列调度的神经网络。除了规模更小、训练时间更短外,所得架构确保项无论其在队列中的位置如何都以相同方式被处理。此外,我们提出一种将基于 DRL 的解高效应用于非常大队列的新方法,并展示我们如何将 MERLIN 有效扩展至处理比其训练所用队列大数个数量级的队列规模。在多种队列规模上的广泛评估表明,MERLIN 以较大优势(>22%)优于多个知名基线。

关键词

引用

@article{arxiv.2007.09256,
  title  = {Hierarchical Deep Reinforcement Learning Approach for Multi-Objective Scheduling With Varying Queue Sizes},
  author = {Yoni Birman and Ziv Ido and Gilad Katz and Asaf Shabtai},
  journal= {arXiv preprint arXiv:2007.09256},
  year   = {2020}
}