基于强化学习的作业车间调度课程学习
人工智能
2023-05-18 v1
摘要
使用固定策略(如优先派工规则)求解作业车间调度问题 (JSSP) 可能对某些问题实例产生满意的结果,但对其他实例则结果不佳。从单一策略的角度来看,即使机器设置保持不变,寻找特定 JSSP 的近优解的难度也各不相同。深度强化学习 (DRL) 是近期被深入研究且极具前景的应对难度可变性的方法,它不仅在训练期间,而且在应用于新情况时,都能动态调整智能体的规划策略以应对困难实例。本文通过将相同问题规模内的难度可变性主动纳入学习过程的设计,进一步改进了 DRL 作为底层方法。我们的方法基于通过 DRL 和图神经网络嵌入求解 JSSP 的最先进方法。我们通过一种课程学习策略对智能体的训练例程进行了补充,该策略利用一种新的问题实例难度指标对训练期间展示的问题实例进行排序。结果表明,特定的课程能显著提升 DRL 解决方案的性能。在这些课程上训练的智能体超越了在随机分布训练数据上训练的智能体的最佳性能,平均完工时间缩短了 3.2%。
引用
@article{arxiv.2305.10192,
title = {Curriculum Learning in Job Shop Scheduling using Reinforcement Learning},
author = {Constantin Waubert de Puiseau and Hasan Tercan and Tobias Meisen},
journal= {arXiv preprint arXiv:2305.10192},
year = {2023}
}
备注
in: Proceedings of the Conference on Production Systems and Logistics: CPSL 2023