使用强化学习与迁移学习的制造派工
机器学习
2019-10-07 v1 人工智能
机器学习
摘要
制造业中高效的派工规则是确保产品准时交付以及最小逾期与库存成本的关键。制造业,尤其在发达国家,正转向按需制造,即高混合、低产量的产品组合。这需要能够在动态与随机环境中工作的高效派工,意味着其能对新收到的订单快速响应,并能在各异的车间设置上工作。本文解决制造中的派工问题。利用强化学习(RL),我们提出一种新的设计,将车间状态表示为二维矩阵,将工件松弛时间纳入状态表示,并设计用于派工目的的延迟与 tardiness 奖励函数。然而,在制造车间为每条生产线维护单独的 RL 模型成本高昂且通常不可行。为此,我们为深度 RL 模型增强了一种派工策略迁移方法。这提升了策略泛化性并节省了模型训练与数据收集的时间与成本。实验表明:(1)我们的方法在总折扣奖励以及平均延迟、tardiness 方面表现最佳;(2)所提出的策略迁移方法减少了训练时间并提升了策略泛化性。
引用
@article{arxiv.1910.02035,
title = {Manufacturing Dispatching using Reinforcement and Transfer Learning},
author = {Shuai Zheng and Chetan Gupta and Susumu Serita},
journal= {arXiv preprint arXiv:1910.02035},
year = {2019}
}
备注
ECML PKDD 2019 (The European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases, 2019)