一种基于深度双循环智能体并采用策略梯度求解作业车间调度问题的 actor-critic 算法
最优化与控制
2023-11-22 v2 人工智能
机器学习
摘要
将机器学习技术与优化相结合以解决具有挑战性的优化问题正受到越来越多的关注。本文提出了一种用于作业车间调度问题(JSSP)的深度强化学习方法。其目标是构建一种类似贪心的启发式算法,使其能够在具有不同作业数和机器数的 JSSP 实例分布上进行学习。对快速调度方法的需求是众所周知的,它出现在从交通运输到医疗保健的许多领域。我们将 JSSP 建模为马尔可夫决策过程,然后利用强化学习的有效性来求解该问题。我们采用 actor-critic 方案,其中智能体采取的动作受到关于状态值函数的策略考量影响。这些过程经过调整以适应 JSSP 的挑战性本质,即状态空间和动作空间不仅在每个实例中不同,而且在每次决策后也会发生变化。为了应对输入中作业数和工序数的变化,我们使用两个关联的 LSTM 模型(一种特殊类型的深度神经网络)对智能体进行建模。实验表明,该算法能在短时间内获得较好的解,证明仅通过基于学习的方法即可生成新的贪心启发式算法。我们与商业求解器 CPLEX 进行了基准对比测试。正如预期的那样,该模型在一定程度上可以泛化到更大的问题或由与训练时不同的分布所产生的实例。
引用
@article{arxiv.2110.09076,
title = {An actor-critic algorithm with policy gradients to solve the job shop scheduling problem using deep double recurrent agents},
author = {Marta Monaci and Valerio Agasucci and Giorgio Grani},
journal= {arXiv preprint arXiv:2110.09076},
year = {2023}
}