中文

DeepStock:基于策略正则化的强化学习库存管理

机器学习 2026-03-23 v1 人工智能

摘要

深度强化学习 (DRL) 提供了一种通用的机器学习方法,可用于训练能够利用大数据和计算资源的库存政策。然而,现有的 DRL 实现在实际应用中往往效果不佳,常常对训练期间使用的超参数高度敏感。本文表明,通过施加基于经典库存概念(如“基准库存”)的政策正则化,可显著加快超参数调优速度,并提高几种 DRL 方法的最终性能。我们报告了在阿里巴巴电商平台天猫上 100% 部署使用政策正则化的 DRL 的详细情况。我们还包括了大量的人工合成实验,显示政策正则化对库存管理领域最佳 DRL 方法的选择产生了深远的影响。

关键词

引用

@article{arxiv.2603.19621,
  title  = {DeepStock: Reinforcement Learning with Policy Regularizations for Inventory Management},
  author = {Yaqi Xie and Xinru Hao and Jiaxi Liu and Will Ma and Linwei Xin and Lei Cao and Yidong Zhang},
  journal= {arXiv preprint arXiv:2603.19621},
  year   = {2026}
}