中文

面向药品供应链的经典与深度强化学习库存控制策略:考虑腐败性与非平稳性

人工智能 2025-01-22 v1 机器学习 最优化与控制

摘要

我们研究药品供应链的库存控制策略,解决诸如腐败性、产量不确定性和非平稳需求等挑战,同时结合批次约束、提前期和缺货。与百氏制药(BMS)合作,我们构建包含这些因素的真实案例研究,并对照基于人类经验的 BMS 基准,对三种策略——订单累积(OUT)、投影库存水平(PIL)和使用近端策略优化(PPO)算法的深度强化学习(DRL)进行基准测试。我们推导并验证了用于优化 OUT 和 PIL 策略参数的界限程序,并提出了估计投影库存水平的方法,这些方法也集成到 DRL 策略中,用于改进在非平稳情况下的决策。与由人工驱动的策略相比,后者通过提高持有成本来避免缺货,所有实现的策略在平均成本方面都实现了更低的成本,但表现出更大的成本波动。虽然 PIL 在鲁棒性和一致性方面表现出色,但 OUT 在高缺货成本下难以为继,PPO 在复杂且变化的场景中表现出色,但需要大量计算资源。研究结果表明,尽管 DRL 显示出潜力,但在所有数值实验中都不一定优于经典策略,突显了 1)需整合多样化策略来有效应对药品领域的挑战,基于当前最新方法,以及 2)该领域的实际问题似乎缺乏一种单一的策略类别能产生普遍可接受的性能。

关键词

引用

@article{arxiv.2501.10895,
  title  = {Classical and Deep Reinforcement Learning Inventory Control Policies for Pharmaceutical Supply Chains with Perishability and Non-Stationarity},
  author = {Francesco Stranieri and Chaaben Kouki and Willem van Jaarsveld and Fabio Stella},
  journal= {arXiv preprint arXiv:2501.10895},
  year   = {2025}
}