用于学习作业车间调度派发的离线强化学习
机器学习
2025-07-04 v4 人工智能
摘要
作业车间调度问题(JSSP)是一个复杂的组合优化问题。尽管在线强化学习(RL)因能快速为 JSSP 找到可接受的解而展现出前景,但它面临关键局限性:需要从零开始进行大量训练交互,导致样本效率低下;无法利用约束规划(CP)等传统方法现有的高质量解;并且需要在模拟环境中进行训练,这对于复杂的调度环境来说是不切实际的。我们引入了离线学习派发,这是一种用于 JSSP 的离线强化学习方法,通过从历史调度数据中学习来解决这些局限性。我们的方法适用于拥有历史调度数据和专家解的场景,或者使用模拟环境进行 RL 方法在线训练不切实际的场景。Offline-LD 引入了两种 Q 学习方法的可掩码变体,即可掩码分位数回归 DQN(mQRDQN)和离散可掩码 Soft Actor-Critic(d-mSAC),它们能够通过保守 Q 学习(CQL)从历史数据中学习。此外,我们针对可掩码动作空间提出了对 d-mSAC 的熵奖励修改。而且,我们引入了一种用于离线 RL 设置下 JSSP 的新型奖励归一化方法。我们的实验表明,在仅使用 CP 生成的 100 个解进行训练时,Offline-LD 在生成实例和基准实例上均优于在线 RL。值得注意的是,在专家数据集中引入噪声,与使用同等数量实例的专家数据集相比,产生了相当或更好的结果,这对于数据本质上充满噪声且不完美的现实世界应用来说是一个有前景的发现。
引用
@article{arxiv.2409.10589,
title = {Offline Reinforcement Learning for Learning to Dispatch for Job Shop Scheduling},
author = {Jesse van Remmerden and Zaharah Bukhsh and Yingqian Zhang},
journal= {arXiv preprint arXiv:2409.10589},
year = {2025}
}
备注
Accepted in Machine Learning