面向供应链中多产品多节点库存管理的强化学习
机器学习
2020-06-09 v1 人工智能
多智能体系统
机器学习
摘要
本文描述了强化学习(RL)在供应链多产品库存管理中的应用。问题描述与解决方案均改编自真实的业务方案。相较于供应链文献,该问题的新颖之处在于:(i)我们考虑具有共享容量的大量(50 至 1000)产品的并发库存管理;(ii)我们考虑由供应三家门店的仓库构成的多节点供应链;(iii)仓库、门店以及从仓库到门店的运输均具有有限容量;(iv)仓库与门店的补货在不同时间尺度上发生且存在实际时间滞后;(v)门店处产品的需求是随机的。我们描述了一种多智能体(分层)强化学习框架中的新颖建模,可用于并行化决策,并使用优势 actor-critic(A2C)算法与量化动作空间来求解该问题。实验表明,所提方法能够处理由最大化产品销售额与最小化易腐产品浪费构成的多目标奖励。
引用
@article{arxiv.2006.04037,
title = {Reinforcement Learning for Multi-Product Multi-Node Inventory Management in Supply Chains},
author = {Nazneen N Sultana and Hardik Meisheri and Vinita Baniwal and Somjit Nath and Balaraman Ravindran and Harshad Khadilkar},
journal= {arXiv preprint arXiv:2006.04037},
year = {2020}
}