强化学习为现实供应链安全库存优化提供灵活途径
多智能体系统
2021-07-05 v1
摘要
尽管安全库存优化已被研究逾 60 年,多数企业仍使用简化方法计算必要的安全库存水平,部分原因在于现有解析方法侧重于推导可证明最优解,与企业更倾向于牺牲最优结果以换取更现实问题设定的偏好不相匹配。人工智能(AI)领域新兴的方法,即强化学习(RL),在容纳更现实问题特征的同时寻找最优解方面展现出前景。与基于解析的模型不同,RL 将问题视为黑盒仿真环境,缓解了过度简化现实的问题。因此,对库存政策的假设可放宽,并可容纳更多问题变量。虽然 RL 在其他领域已很流行,其在安全库存优化中的应用仍很少见。本文中,我们研究三种 RL 方法,即 Q-Learning、时序差分优势 actor-critic 以及多智能体时序差分优势 actor-critic,用于优化由独立智能体组成的线性链中的安全库存。我们发现 RL 可同时优化库存政策的安库存水平和订货量参数,而经典安全库存优化模型仅优化安全库存水平、订货量则依据简单规则预先确定。这使得 RL 能建模更复杂的供应链采购行为。然而,RL 求解耗时更长,未来需研究识别并改进 AI 与数学模型使用间的权衡。
引用
@article{arxiv.2107.00913,
title = {Reinforcement Learning Provides a Flexible Approach for Realistic Supply Chain Safety Stock Optimisation},
author = {Edward Elson Kosasih and Alexandra Brintrup},
journal= {arXiv preprint arXiv:2107.00913},
year = {2021}
}
备注
12 pages; 6 figures