中文

基于整数规划的深度策略迭代在库存管理中的应用

机器学习 2025-01-09 v3 人工智能 最优化与控制

摘要

我们提出了一种基于强化学习(RL)的框架,用于优化具有大型组合动作空间与状态依赖约束的长期折扣奖励问题。这些特征常见于许多运营管理问题,例如网络库存补货,其中管理者必须应对不确定需求、销售损失以及导致更复杂可行动作空间的容量约束。我们提出的可编程执行器强化学习(PARL)使用一种深度策略迭代方法,利用神经网络(NNs)逼近值函数,并将其与数学规划(MP)和样本平均近似(SAA)相结合,以在考虑组合动作空间与状态依赖约束集的情况下每步最优求解动作。我们展示了所提方法如何应用于解析解难以处理的高复杂库存补货问题。我们还将所提算法与最先进 RL 算法及常用补货启发式方法进行基准对比,发现其在多种复杂供应链设定下平均优于现有方法达 14.7%。我们发现,PARL 相对于基准算法的这一改进可直接归因于更好的库存成本管理,尤其在库存受限设定中。此外,在最优补货策略可处理或存在已知近最优启发式的较简单设定中,我们发现 RL 方法能够学习近最优策略。最后,为使 RL 算法更易于被库存管理研究者使用,我们还讨论了一个模块化 Python 库的开发,该库可用于测试 RL 算法在各种供应链结构下的性能,并促进未来针对库存管理问题开发实用且近最优算法的研究。

关键词

引用

@article{arxiv.2112.02215,
  title  = {Deep Policy Iteration with Integer Programming for Inventory Management},
  author = {Pavithra Harsha and Ashish Jagmohan and Jayant Kalagnanam and Brian Quanz and Divya Singhvi},
  journal= {arXiv preprint arXiv:2112.02215},
  year   = {2025}
}

备注

Prior shorter version accepted to NeurIPS 2021 Deep RL Workshop. Updated version to appear in MSOM journal. Authors are listed in alphabetical order