面向动态物料搬运的约束强化学习
机器学习
2023-05-24 v1 人工智能
机器人学
摘要
作为柔性制造系统的核心部分之一,物料搬运涉及物料在 workstation 之间借助自动搬运车的存储与运输。物料搬运的改进可推动制造系统的整体效率。然而,在任务排程优化过程中动态事件的发生带来了需要适应性与有效性的挑战。本文针对动态物料搬运的自动导引车调度问题展开研究。受一些真实场景启发,未知新任务和意外车辆故障被视为我们问题中的动态事件。我们将该问题建模为约束马尔可夫决策过程,分别将 tardiness 和可用车辆数作为累积约束和瞬时约束。提出了一种结合拉格朗日松弛与无效动作掩码的自适应约束强化学习算法,称为 RCPOM,以解决带两类混合约束的问题。此外,开发了一个类 gym 的动态物料搬运模拟器,称为 DMH-GYM,并配备多样化问题实例,可用作动态物料搬运的基准。在问题实例上的实验结果表明,与八种最先进的约束与非约束强化学习算法以及广泛使用的物料搬运调度规则相比,我们所提方法具有卓越性能。
关键词
引用
@article{arxiv.2305.13824,
title = {Constrained Reinforcement Learning for Dynamic Material Handling},
author = {Chengpeng Hu and Ziming Wang and Jialin Liu and Junyi Wen and Bifei Mao and Xin Yao},
journal= {arXiv preprint arXiv:2305.13824},
year = {2023}
}
备注
accepted by the 2023 International Joint Conference on Neural Networks (IJCNN)