中文

用于化工生产过程调度的分布强化学习

系统与控制 2022-03-11 v2 机器学习 系统与控制

摘要

强化学习(RL)近期受到过程系统工程与控制领域的广泛关注。已有工作研究了在不确定性下应用 RL 确定最优调度决策。在本工作中,我们提出一种专门用于高效处理不确定性下生产调度问题的 RL 方法。我们考虑了此类问题中常见的限制,如优先约束和析取约束,这些在其他情境下的 RL 中通常不被自然考虑。此外,本工作自然地实现了对风险敏感公式(如条件风险价值 CVaR)的优化,这在现实调度过程中至关重要。所提出的策略在并行批处理生产环境中进行了深入研究,并与混合整数线性规划(MILP)策略进行了基准测试。我们表明,我们的方法所识别的策略能够在在线决策中考虑工厂不确定性,其预期性能与现有 MILP 方法相当。此外,该框架获得了优化风险敏感度量的优势,并且识别在线决策的速度比最高效的优化方法快数个数量级。这有望缓解实际问题,并简化在线生产调度范式中处理过程不确定性实现的工作。

关键词

引用

@article{arxiv.2203.00636,
  title  = {Distributional Reinforcement Learning for Scheduling of Chemical Production Processes},
  author = {Max Mowbray and Dongda Zhang and Ehecatl Antonio Del Rio Chanona},
  journal= {arXiv preprint arXiv:2203.00636},
  year   = {2022}
}