中文

面向一般到货动态学习库存控制策略

机器学习 2024-01-23 v2 机器学习

摘要

在本文中,我们解决在一般到货动态下学习与回测库存控制策略的问题——我们称之为按时间量化到货模型(QOT)。我们还允许将订单数量作为后处理步骤进行修改,以满足供应商约束(如订单最小值与批量大小约束)——这是真实供应链中的常见做法。据我们所知,这是首项处理任意到货动态或订单数量任意下游后处理的工作。基于近期工作(Madeka et al., 2022),我们类似地将周期盘点库存控制问题表述为外生决策过程,其中大部分状态不受智能体控制。Madeka et al., 2022 展示了如何构建重放历史数据的模拟器以解决该类问题。在我们的案例中,我们将用于到货过程的深度生成模型作为历史重放的一部分。通过将问题表述为外生决策过程,我们可应用 Madeka et al., 2022 的结果以获得向监督学习的归约。通过仿真研究,我们表明该方法在盈利性上相较生产基线取得统计显著的提升。利用真实世界 A/B 测试数据,我们展示 Gen-QOT 能很好地泛化至离屏策略数据,且所得采购策略在真实场景中优于传统库存管理系统。

关键词

引用

@article{arxiv.2310.17168,
  title  = {Learning an Inventory Control Policy with General Inventory Arrival Dynamics},
  author = {Sohrab Andaz and Carson Eisenach and Dhruv Madeka and Kari Torkkola and Randy Jia and Dean Foster and Sham Kakade},
  journal= {arXiv preprint arXiv:2310.17168},
  year   = {2024}
}