基于强化学习的多目标多级供应链优化
人工智能
2025-07-29 v1
摘要
本研究基于马尔可夫决策过程构建了一个非平稳市场下的广义多目标、多级供应链优化模型,综合考虑了经济、环境与社会因素。该模型采用多目标强化学习(RL)方法进行评估,并与使用预定义权重修改为加权和的原始单目标RL算法以及基于多目标进化算法(MOEA)的方法进行了基准对比。我们在不同网络复杂度下进行了实验,利用可定制的模拟器模拟典型的现实挑战。该模型确定跨供应链路线的生产和交付数量,以在竞争目标间实现近最优的权衡,逼近 Pareto 前沿集。结果表明,主要方法在最优性、多样性和密度之间提供了最均衡的权衡,且通过允许策略间知识迁移的共享经验缓冲区进一步增强。在复杂环境中,其超体积比基于 MOEA 的方法高出达 75%,生成的解比修改后的单目标 RL 方法稠密约十一倍,表明具有更好的鲁棒性。此外,它在最小化需求损失的同时确保了稳定的生产和库存水平。
引用
@article{arxiv.2507.19788,
title = {Reinforcement Learning for Multi-Objective Multi-Echelon Supply Chain Optimisation},
author = {Rifny Rachman and Josh Tingey and Richard Allmendinger and Pradyumn Shukla and Wei Pan},
journal= {arXiv preprint arXiv:2507.19788},
year = {2025}
}