中文

库存政策的 VC 理论

动力系统 2025-01-03 v4

摘要

对库存管理的强化学习 (RL) 应用日益增长,既可通过优化时间依赖的转换,也可直接从完整的历史需求轨迹中学习。这与经典数据驱动方法形成鲜明对比,后者首先从过往数据中估计需求分布,然后通过动力学规划计算结构良好的最优政策。本文考虑一种混合方法,将基于轨迹的 RL 与强制 base-stock 和 (s,S)(s, S) 结构的政策正则化相结合。我们使用诸如 Pseudo-dimension 和 Fat-shattering dimension 等来自尊威-切尔沃奈克 (VC) 理论中的工具,为该组合方法提供一般化保证,可用于 TT 期动态库存模型中的几个著名类别。我们的结果对最佳政策的后悔率具有意义,并且允许对需求序列采用任意分布,无需诸如时间跨度独立性等假设。令人惊讶的是,我们证明由 TT 个非平稳 base-stock 水平定义的政策类别,其一般化误差随 TT 而不增长;而两个参数的 (s,S)(s, S) 政策类别的一般化误差随 TT 而对数增长。总体而言,我们的分析将特定的库存结构纳入学习理论框架,并且即使针对现有结果(假设需求独立)也能改进样本复杂度保证。

关键词

引用

@article{arxiv.2404.11507,
  title  = {Fluctuation of ergodic averages and other stochastic processes},
  author = {Sovanlal Mondal and Joe Rosenblatt and Máté Wierdl},
  journal= {arXiv preprint arXiv:2404.11507},
  year   = {2025}
}

备注

31 pages, no figures. Some typos and presentation of proofs are modified based on the referee's suggestions