中文

强化学习作为现实生产调度问题的改进启发式方法

机器学习 2024-09-19 v1

摘要

将强化学习(RL)与启发式方法集成是解决优化问题的新兴趋势,利用 RL 能够从搜索过程中生成的数据中学习的能力。一种有前景的做法是将 RL 代理训练为改进启发式方法,从次优解开始,通过应用小变更来逐步改进解。我们将此方法应用于现实世界的多目标生产调度问题。我们的方案包括用于学习作业之间关系的 Transformer 编码器架构。随后生成概率矩阵,从中对作业对进行抽样,然后交换以改进解。我们使用来自行业合作伙伴的真实数据对该方案与其他启发式方法进行基准测试,证明其性能优越。

关键词

引用

@article{arxiv.2409.11933,
  title  = {Reinforcement Learning as an Improvement Heuristic for Real-World Production Scheduling},
  author = {Arthur Müller and Lukas Vollenkemper},
  journal= {arXiv preprint arXiv:2409.11933},
  year   = {2024}
}

备注

This paper was accepted at the ICMLA 2024