中文

ORPR:面向库存管理的一种基于运营研究导向的预训练-强化学习模型

人工智能 2026-01-07 v2 机器学习

摘要

随着人工智能(AI)与运营研究(OR)在处理复杂库存系统方面寻求协同发展的趋势日益凸显,仍存在一个关键挑战:如何有效地将AI的自适应感知与OR的结构严谨性相结合。为弥合这一鸿沟,我们提出了一种新颖的OR引导的“预训练-强化学习”框架。为提供结构化指导,我们提出了一种通过仿真增强的OR模型,生成高质量的参考决策,隐式地捕捉复杂的业务约束和管理层偏好。利用这些来自OR的决策作为基础训练标签,我们设计了一种领域感知的深度学习基础模型,以建立基础的决策能力,然后进行强化学习(RL)微调阶段。独特之处在于,我们将RL定位为一种深度对齐机制,使AI智能体能够内化OR的最优原则,同时利用探索进行通用策略的细化,并允许针对特定情景(如促销活动)的专家指导。通过大量数值实验和在京东公司(JD.com)进行的现场部署(采用差分-差分(DiD)分析),我们的模型显著优于现行的工业实践,实现了周转时间缩短5.27天、缺货率提升2.29%,以及库存持有成本降低29.95%。与当前模型规模扩张的暴力做法相反,我们的研究表明,在结构化OR逻辑的指导下,轻量级、领域感知的模型能够实现最先进的性能并表现出稳健的迁移能力。这种方法为智能供应链管理提供了一种可扩展且成本效益高的范式,凸显了深度对齐AI与OR的价值。

关键词

引用

@article{arxiv.2512.19001,
  title  = {ORPR: An OR-Guided Pretrain-then-Reinforce Learning Model for Inventory Management},
  author = {Lingjie Zhao and Xue Yu and Yongzhi Qi and Hao Hu and Jianshen Zhang and Yingzheng Ma and Shuyu Han and Wei Qi and Zuo-Jun Max Shen},
  journal= {arXiv preprint arXiv:2512.19001},
  year   = {2026}
}