中文

面向库存控制的深度受控学习

机器学习 2025-06-04 v7

摘要

深度强化学习(DRL)在库存管理中的应用是一个新兴领域。然而,最初为游戏博弈和机器人等多样领域开发的经典DRL算法,可能并不适合库存管理所特有的挑战。因此,这些算法往往无法超越既有启发式方法;例如,在缺货库存控制中,现无一种DRL方法能稳定超越封顶基库存策略。这凸显了DRL在库存管理实际应用中的一个关键缺口:库存问题高度随机的本质需要量身定制的解决方案。对此,我们提出深度受控学习(DCL),一种为高度随机问题设计的新型DRL算法。DCL基于近似策略迭代,并融合一种高效仿真机制,将序贯减半(Sequential Halving)与公共随机数(Common Random Numbers)相结合。我们的数值研究表明,DCL在包括缺货、易腐库存系统以及含随机提前期库存系统在内的多种库存设定中,稳定优于最先进启发式方法与DRL算法。DCL在所有测试用例中均实现更低平均成本,同时将最优性差距保持在不超过0.2%。值得注意的是,所有实验使用同一超参数集即达成此性能,凸显了我们方法的鲁棒性与泛化性。这些发现有助于持续推进库存管理中定制化DRL算法的探索,为该领域的进一步研究与实用化奠定基础。

关键词

引用

@article{arxiv.2011.15122,
  title  = {Deep Controlled Learning for Inventory Control},
  author = {Tarkan Temizöz and Christina Imdahl and Remco Dijkman and Douniel Lamghari-Idrissi and Willem van Jaarsveld},
  journal= {arXiv preprint arXiv:2011.15122},
  year   = {2025}
}