基于策略与动作掩码的强化学习应对不确定环境下动态作业车间调度:处理随机到达与机器故障
人工智能
2026-01-15 v1
摘要
我们提出了一种求解不确定环境下动态作业车间调度问题(Dynamic Job Shop Scheduling Problems)的新框架,以应对随机作业到达和意外机器故障带来的挑战。我们的方法遵循基于模型的范式,使用着色时间 Petri 网表示调度环境,并采用可掩码近端策略优化(Maskable Proximal Policy Optimization)实现动态决策,同时将智能体在每个决策点限制在可行动作内。为模拟真实的工业条件,动态作业到达使用 Gamma 分布建模,以捕捉突发、聚集和波动的工作负载等复杂时间模式。机器故障使用 Weibull 分布建模,以表示随龄退化与磨损动态。这些随机模型使框架能更好地反映真实世界的制造场景。此外,我们研究了两种动作掩码策略:一种是无梯度方法,覆盖无效动作的概率;另一种是基于梯度的方法,在策略网络中为无效动作分配负梯度。我们在动态 JSSP 基准上进行了大量实验,证明我们的方法在最小化最大完工时间方面始终优于传统的启发式和基于规则的方法。结果突显了将可解释的基于 Petri 网的模型与自适应强化学习策略相结合的优势,为动态和不确定制造环境中的实时调度生成了一个具韧性、可扩展且可解释的框架。
引用
@article{arxiv.2601.09293,
title = {Policy-Based Reinforcement Learning with Action Masking for Dynamic Job Shop Scheduling under Uncertainty: Handling Random Arrivals and Machine Failures},
author = {Sofiene Lassoued and Stefan Lier and Andreas Schwung},
journal= {arXiv preprint arXiv:2601.09293},
year = {2026}
}