基于智能体的连续变化供应链建模
系统与控制
2023-12-27 v1 人工智能
机器学习
系统与控制
摘要
问题定义:供应链是不断演变的网络。强化学习日益被提议作为提供这些网络最优控制的解决方案。学术/实践:然而,在连续变化的环境中进行学习仍然是强化学习文献中的一个挑战。方法:因此,本文旨在探讨智能体能否控制变化的供应链问题,在需要不同策略的环境之间转移学习,并避免对一段时间未见的任务产生灾难性遗忘。为了评估这种方法,比较了两种最先进的强化学习 (RL) 算法:一种演员 - 评论家学习器,即近端策略优化 (PPO),以及带有长短期记忆 (LSTM) 层的循环近端策略优化 (RPPO),后者在在线学习环境中显示出流行度。结果:首先,在六组具有不同随机程度的环境中比较了这些方法。结果表明,在批量环境中采用的更精益策略与在具有不同产品的随机环境中采用的策略不同。这些方法还在各种连续供应链场景中进行了比较,结果显示 PPO 智能体在任务相似时能够通过持续学习进行适应,但在极端任务之间切换时表现出更不稳定的性能。然而,具有记忆历史能力的 RPPO 能够在一定程度上克服这一问题,并采取更现实的策略。管理启示:我们的结果为连续变化的供应链提供了新的视角,在不确定和半连续非平稳的供应链环境中,无需随着需求变化重新训练环境,智能体之间的合作与协调对于提高整体性能至关重要。
引用
@article{arxiv.2312.15502,
title = {Agent based modelling for continuously varying supply chains},
author = {Wan Wang and Haiyan Wang and Adam J. Sobey},
journal= {arXiv preprint arXiv:2312.15502},
year = {2023}
}