基于深度强化学习的具有不确定季节性需求与提前期的多层级供应链
机器学习
2022-01-14 v1 人工智能
摘要
我们解决了多层级供应链中的生产规划与分销问题。我们考虑不确定需求与提前期,使问题呈随机且非线性。给出了马尔可夫决策过程表述与非线性规划模型。作为序贯决策问题,深度强化学习(RL)是一种可能的求解途径。此类技术近年来受到人工智能与优化领域的广泛关注。鉴于深度 RL 方法在不同领域取得的良好结果,将其应用于运筹学领域问题的兴趣日益增长。我们采用了一种深度 RL 技术即近端策略优化(PPO2)求解该问题,考虑不确定、规则与季节性需求以及恒定或随机提前期。在不同场景中进行实验以更好评估算法适用性。基于线性化模型的智能体用作基线。实验结果表明 PPO2 对此类问题是具有竞争力且合适的工具。在全部随机提前期场景中(7.3–11.2%),PPO2 智能体优于基线,无论需求是否季节性。在恒定提前期场景中,当不确定需求为非季节性时 PPO2 智能体更优(2.2–4.7%)。结果表明场景不确定性越大,此类方法的可行性越高。
引用
@article{arxiv.2201.04651,
title = {Multi-echelon Supply Chains with Uncertain Seasonal Demands and Lead Times Using Deep Reinforcement Learning},
author = {Julio César Alves and Geraldo Robson Mateus},
journal= {arXiv preprint arXiv:2201.04651},
year = {2022}
}
备注
35 pages, 16 figures