PROPEL:大规模供应链规划的监督学习与强化学习
机器学习
2025-04-11 v1 人工智能
摘要
本文探讨如何将机器学习(ML)与优化技术相结合,以解决大规模供应链规划(SCP)优化问题。这些问题可形式化为包含整数(非二进制)和连续变量、以及流量平衡和容量约束的 MIP 模型。这引发了针对已集成 ML 与优化技术的根本性挑战,这些技术专注于二进制 MIP 和图问题。为此,本文提出了 PROPEL 框架,将优化与监督学习和深度强化学习(DRL)相结合,以显著缩小搜索空间。PROPEL 使用监督学习而非预测所有整数变量的值,而是识别在最优解中被固定为零的变量,利用 SCP 应用的结构。PROPEL 包含一个 DRL 组件,用于在监督学习步骤未产生所需最优容忍度的解时,选择哪些被固定为零的变量需要放松以提高解的质量。PROPEL 已应用于具有数百万变量的工业供应链规划优化。计算结果显示,解决方案时间和质量都得到了显著的改进,包括 60% 的原始积分减少和 88% 的原始间隙缩减,改进因子分别最高可达 13.57 和 15.92。
引用
@article{arxiv.2504.07383,
title = {PROPEL: Supervised and Reinforcement Learning for Large-Scale Supply Chain Planning},
author = {Vahid Eghbal Akhlaghi and Reza Zandehshahvar and Pascal Van Hentenryck},
journal= {arXiv preprint arXiv:2504.07383},
year = {2025}
}