中文

面向库存管理的结构信息深强化学习

机器学习 2025-07-30 v1 最优化与控制

摘要

本文探讨了将深度强化学习(DRL)应用于经典库存管理问题的应用,特别关注实际实施中的考量。我们应用基于DirectBackprop的DRL算法,用于包括多期系统(带有和不带有交货期的缺货)、perishable库存管理、双来源采购以及联合库存采购与移除的若干基本库存管理场景。DRL方法仅使用在实际情境中可用的历史信息来学习策略,避免对需求分布的不切实际假设或获取分布参数的要求。我们展示了该通用DRL实现在这些多样化的情境中,能够与或超过既定基准和启发式方法,同时只需最小的参数调优。通过对所学策略的分析,我们表明DRL方法自然捕获了来自传统运营研究方法所推导的许多最优策略的结构属性。为进一步提高策略性能和可解释性,我们提出了一种结构信息策略网络技术,显式地将从分析中推导出的最优策略的特征纳入学习过程。该方法有助于提高可解释性,并在样本外性能方面增强策略的鲁棒性,我们在一个具有现实需求数据的数据示例中予以证明。最后,我们提供了DRL在非平稳情境下的 illustrative应用。我们的工作在数据驱动学习与分析见解之间搭建了桥梁,同时保持了实际可行性。

关键词

引用

@article{arxiv.2507.22040,
  title  = {Structure-Informed Deep Reinforcement Learning for Inventory Management},
  author = {Alvaro Maggiar and Sohrab Andaz and Akhil Bagaria and Carson Eisenach and Dean Foster and Omer Gottesman and Dominique Perrault-Joncas},
  journal= {arXiv preprint arXiv:2507.22040},
  year   = {2025}
}