超越次优性的泛化:离线强化学习通过随机数据学习有效的调度
机器学习
2025-09-15 v1 人工智能
摘要
作业车间调度问题(JSP)和柔性作业车间调度问题(FJSP)是经典的组合优化问题,在工业运营中有广泛应用。近年来,许多在线强化学习(RL)方法被提出用于学习 JSP 和 FJSP 的构造式启发式算法。尽管这些在线 RL 方法有效,但它们需要与模拟环境进行数百万次交互,而这些环境可能无法捕捉真实世界的复杂性,且其随机策略初始化导致样本效率低下。为解决这些局限性,我们引入了保守离散分位数 Actor-Critic(CDQAC),这是一种新颖的离线 RL 算法,可直接从历史数据中学习有效的调度策略,消除了昂贵的在线交互需求,同时保持了在次优训练数据基础上进行改进的能力。CDQAC 将基于分位数的 critic 与延迟策略更新相结合,估计每个机器-操作对的回报分布,而不是直接选择操作对。我们广泛的实验证明了 CDQAC 从不同数据源学习的卓越能力。CDQAC 始终优于原始的数据生成启发式算法,并超越了 SOTA 的离线和在线 RL 基线。此外,CDQAC 具有极高的样本效率,仅需 10-20 个训练实例即可学习高质量策略。令人惊讶的是,我们发现 CDQAC 在使用随机启发式生成的数据上进行训练时,其表现优于使用来自遗传算法和优先分派规则的更高质量数据进行训练。
引用
@article{arxiv.2509.10303,
title = {Generalizing Beyond Suboptimality: Offline Reinforcement Learning Learns Effective Scheduling through Random Data},
author = {Jesse van Remmerden and Zaharah Bukhsh and Yingqian Zhang},
journal= {arXiv preprint arXiv:2509.10303},
year = {2025}
}