中文

gym-invmgmt:面向库存管理方法的开放基准测试框架

机器学习 2026-05-13 v1 计算工程、金融与科学

摘要

库存策略的比较通常难以解读,因为其性能既取决于策略本身,也取决于评估合约。拓扑结构、需求模式、信息获取、可行性约束、缺货处理以及关键绩效指标(KPI)定义的差异都可能改变方法的排名。我们推出了 gym-invmgmt,这是一个兼容 Gymnasium 的 OR-Gym 库存管理系列扩展,用于可审计的跨范式评估。该基准在共享的 CoreEnv 状态转移、奖励、动作边界和 KPI 合约下评估优化、启发式和基于学习的控制器,同时通过一个包含 22 个场景的核心网格以及四个补充的多智能体强化学习(MARL)模式行来改变压力条件。在这些已发布的场景中,基于信息的随机规划提供了最强的非神谕参考,反映了在预测信息获取下场景对冲的价值,但其在线计算成本显著更高。在学习控制器中,近端策略优化 Transformer 变体(PPO-Transformer)在快速推理下实现了最强的学习策略质量,而残差强化学习(Residual RL)则提供了有竞争力的混合性能。图神经网络变体(PPO-GNN)在默认的发散拓扑上极具竞争力,但在串联拓扑上鲁棒性较差。模仿学习在平稳状态下表现良好,但在需求变化下性能下降,而有界大语言模型(LLM)策略参数基线最好被解释为一种诊断控制器,而非自主库存优化器。总体而言,该基准测试识别出了特定场景下的领先方法,同时表明性能共同取决于信息获取、需求变化、拓扑结构和策略表示。

关键词

引用

@article{arxiv.2605.11355,
  title  = {gym-invmgmt: An Open Benchmarking Framework for Inventory Management Methods},
  author = {Reza Barati and Qinmin Vivian Hu},
  journal= {arXiv preprint arXiv:2605.11355},
  year   = {2026}
}

备注

16 pages, 4 figures