解开彩虹:基于值的方法能否进行调度?
机器学习
2025-12-01 v2
摘要
在这项工作中,我们对几种深度强化学习算法在两个具有挑战性的组合优化问题上进行了广泛的实证研究:作业车间调度问题和柔性作业车间调度问题,这两个都是具有多种工业应用的基础性挑战。大体上,深度强化学习算法分为两类:策略梯度和基于价值的方法。虽然基于价值的方法在诸如 Arcade Learning Environment 等领域取得了显著成功,但组合优化社区主要青睐策略梯度算法,常常忽视了基于价值方法的潜力。从我们的结果来看,与策略梯度算法相比,基于价值的算法表现出更低的方差和更稳定的收敛曲线。此外,它们实现了更优的跨规模和跨分布泛化能力,即能够有效解决比训练期间看到的实例大得多或结构上截然不同的实例。最后,我们的分析还表明,每类算法的相对性能可能取决于问题的结构特性,例如问题灵活性和实例规模。总体而言,我们的发现挑战了策略梯度算法在组合优化中固有优越的普遍假设。相反,我们展示了基于价值的算法可以匹敌甚至超越策略梯度算法的性能,这表明它们值得组合优化社区给予更多关注。我们的代码公开在:https://github.com/AJ-Correa/Unraveling-the-Rainbow
引用
@article{arxiv.2505.03323,
title = {Unraveling the Rainbow: can value-based methods schedule?},
author = {Arthur Corrêa and Alexandre Jesus and Paulo Nascimento and Cristóvão Silva and Samuel Moniz},
journal= {arXiv preprint arXiv:2505.03323},
year = {2025}
}