中文

Launchpad:利用离线与在线强化学习方法进行调度学习

机器学习 2022-12-05 v2 分布式、并行与集群计算

摘要

深度强化学习算法已在若干具有挑战性的领域取得成功。经典的在线强化学习作业调度器能够学习高效的调度策略,但通常需要数千时间步来探索环境并从一个随机初始化的 DNN 策略中适应。现有强化学习调度器忽视了从历史数据中学习并改进定制启发式策略的重要性。离线强化学习提出了从预记录数据集进行策略优化而无需在线环境交互的前景。继近期数据驱动学习的成功之后,我们探索两种强化学习方法:1)行为克隆与 2)离线强化学习,旨在从日志数据中学习策略而无需与环境交互。这些方法解决了有关数据收集成本与安全性的挑战,而这些对强化学习的现实应用尤为关键。尽管数据驱动的强化学习方法产生了良好结果,我们表明其性能高度依赖于历史数据集的质量。最后,我们证明通过有效结合先前的专家示范来预训练智能体,可短路随机探索阶段,以在线训练学习到合理策略。我们利用离线强化学习作为跳板(launchpad),从使用 Oracle 或启发式策略收集的先验经验中学习有效的调度策略。此类框架适于从历史数据集预训练,并非常契合通过在线数据收集持续改进。

关键词

引用

@article{arxiv.2212.00639,
  title  = {Launchpad: Learning to Schedule Using Offline and Online RL Methods},
  author = {Vanamala Venkataswamy and Jake Grigsby and Andrew Grimshaw and Yanjun Qi},
  journal= {arXiv preprint arXiv:2212.00639},
  year   = {2022}
}