中文

面向具有随意最优策略的库存系统的基于 Minibatch-SGD 的学习元策略

最优化与控制 2024-08-30 v1 机器学习

摘要

随机梯度下降(SGD)在解决带需求学习的许多库存控制问题中效果良好。然而,它常常面临目标库存水平低于当前库存水平的不可行问题。近期一些工作(如 Huh and Rusmevichientong(2009),Shi 等(2016))已在各种库存系统中成功解决此问题。然而,这些技术相当复杂且难以应用于诸如多产品和多约束库存系统等更复杂的情形。本文从全新的技术视角来解决不可行目标库存水平问题——我们提出一种新的基于 Minibatch-SGD 的学习元策略。我们的元策略足够灵活,可应用于涵盖广泛库存管理问题的通用库存系统框架,其中包含具有随意贪心最优策略的各种问题。通过设计最优的 minibatch 方案,我们的元策略在一般凸情况下的悔 regret 界为 O(T)\mathcal{O}(\sqrt{T}),在强凸情况下的界为 O(logT)\mathcal{O}(\log T)。为展示元策略的强大灵活性,我们将其应用于三个重要的库存控制问题:多产品多约束系统、多层级串联系统以及一仓库多店铺系统,通过仔细设计特定于应用的子程序。我们还进行了大量数值实验,表明我们的元策略在广泛的应用场景下拥有竞争的悔 regret 性能、高计算效率和低方差。

关键词

引用

@article{arxiv.2408.16181,
  title  = {A Minibatch-SGD-Based Learning Meta-Policy for Inventory Systems with Myopic Optimal Policy},
  author = {Jiameng Lyu and Jinxing Xie and Shilin Yuan and Yuan Zhou},
  journal= {arXiv preprint arXiv:2408.16181},
  year   = {2024}
}

备注

Forthcoming in Management Science