基于强化学习的多智能体协作方法用于冶金酸洗线的自适应速度调节
机器学习
2022-04-05 v2 机器学习
摘要
我们以冶金酸洗线为例,提出一种用于提升产能的整体数据驱动方法。所提方法以数学建模为基础算法,并实现一个协作式多智能体强化学习(MARL)系统,以在多准则下提升性能,同时满足安全性与可靠性要求,并考虑某些工艺过程的意外波动。我们展示了深度 Q 学习如何应用于重工业中的实际任务,从而显著改进既有自动化系统。输入数据稀缺问题通过 LSTM 与 CGAN 的两步组合解决,该组合兼顾数据的表格表示及其序列特性。在此设定下必需的离线 RL 训练,借助精细的概率运动学环境得以实现。
引用
@article{arxiv.2008.06933,
title = {The reinforcement learning-based multi-agent cooperative approach for the adaptive speed regulation on a metallurgical pickling line},
author = {Anna Bogomolova and Kseniia Kingsep and Boris Voskresenskii},
journal= {arXiv preprint arXiv:2008.06933},
year = {2022}
}
备注
8 pages, 6 figures