中文

库存管理中的零样本泛化:训练,然后估计和决定 (Zero-shot Generalization in Inventory Management: Train, then Estimate and Decide)

机器学习 2026-01-21 v3

摘要

在实际库存管理中部署深度强化学习 (DRL) 面临挑战,包括动态环境和不确定的 problem 参数,如需求和提前时间分布。这些挑战凸显了研究空白,表明需要一种统一的框架来建模和解决参数不确定性下的序列决策问题。我们通过探索 DRL for 库存管理中较少探索的领域来应对这一问题:在零样本泛化 (Zero-shot Generalization, ZSG) 下训练通用能力代理 (Generally Capable Agent, GCA)。在这里,GCA 是一套先进的 DRL 策略,旨在处理各种样本问题实例,涵盖多样化的库存挑战。ZSG 指的是在无需重新训练的情况下,将已学策略成功应用于未知参数的未见实例的能力。我们提出了统一的超马尔可夫决策过程 (Super-Markov Decision Process) 表述和训练-然后-估计-决定 (Train, then Estimate and Decide, TED) 框架,用于训练和部署针对库存管理应用而设计的 GCA。TED 框架包括三个阶段:在多样化问题实例上训练 GCA、在部署期间持续估计问题参数、并基于这些估计做出决策。应用于带有缺货的周期性检查库存问题、具有循环需求模式和随机提前时间的库存问题时,我们训练的代理——通常能力损失网络 (Generally Capable Lost Sales Network, GC-LSN)——在问题参数已知时一致优于众所周知的传统政策。此外,在需求和/或提前时间分布最初未知且必须估计的情况下,我们对抗基线方法进行了基准测试,这些方法提供最坏情况的性能保证。我们的 GC-LSN 策略配合 Kaplan-Meier 估计器,被证明能补充这些方法,提供优于经验的性能。

关键词

引用

@article{arxiv.2411.00515,
  title  = {Zero-shot Generalization in Inventory Management: Train, then Estimate and Decide},
  author = {Tarkan Temizöz and Christina Imdahl and Remco Dijkman and Douniel Lamghari-Idrissi and Willem van Jaarsveld},
  journal= {arXiv preprint arXiv:2411.00515},
  year   = {2026}
}