用于啤酒游戏的深度 Q 网络:一种求解库存优化问题的深度强化学习算法
机器学习
2020-10-15 v4 多智能体系统
摘要
啤酒游戏是一种广泛使用的课堂游戏,在供应链管理课程中进行以演示牛鞭效应。该游戏是一个去中心化、多智能体、协作的问题,可以建模为一个串行供应链网络,其中智能体协作尝试最小化网络的总成本,即使每个智能体只能观察其自身的局部信息。每个智能体选择订单数量以补充其库存。在某些条件下,已知基础库存补货策略是最优的。然而,在部分智能体(阶段)可能非理性行动的去中心化供应链中(如他们在啤酒游戏中所做的那样),对于希望采取最优行动的智能体而言,没有已知的最优策略。我们提出了一种基于深度 Q 网络的机器学习算法,以优化给定阶段的补货决策。当与遵循基础库存策略的智能体一起游戏时,我们的算法获得了接近最优的订单数量。当其他智能体使用更真实的人类订购行为模型时,它的表现远优于基础库存策略。与文献中的大多数其他算法不同,我们的算法对啤酒游戏参数值没有任何限制。与任何深度学习算法一样,训练该算法的计算量可能很大,但这可以提前进行;在游戏进行时,该算法可以实时执行。此外,我们提出了一种迁移学习方法,使得为一个智能体和一组成本系数执行的训练能够快速适应其他智能体和成本。我们的算法可以扩展到具有部分观测信息的其他去中心化多智能体协作博弈,这是现实世界供应链问题中常见的一类情况。
引用
@article{arxiv.1708.05924,
title = {A Deep Q-Network for the Beer Game: A Deep Reinforcement Learning algorithm to Solve Inventory Optimization Problems},
author = {Afshin Oroojlooyjadid and MohammadReza Nazari and Lawrence Snyder and Martin Takáč},
journal= {arXiv preprint arXiv:1708.05924},
year = {2020}
}