中文

用于批式生物过程优化的强化学习

最优化与控制 2019-09-30 v3 系统与控制

摘要

生物过程因可生产清洁且可持续的化石基材料替代物而备受关注。然而,由于其非稳态操作模式与随机行为,它们通常难以优化。此外,生物系统高度复杂,因此常存在模型-工厂失配。为应对上述挑战,我们提出了一种基于强化学习的批式过程优化策略。在这项工作中,我们应用策略梯度方法从批到批更新由循环神经网络参数化的控制策略。我们假设存在一个初步的过程模型,利用其获得初步的最优控制策略。随后,该策略基于真实工厂的观测数据进行更新。我们所提方法的能力在三个案例研究(其中一个非光滑)上进行了测试,真实系统采用更复杂的嵌入了适当过程扰动的过程模型。最后,我们讨论了该策略相较于现有方法(如非线性模型预测控制)的优缺点。

关键词

引用

@article{arxiv.1904.07292,
  title  = {Reinforcement Learning for Batch Bioprocess Optimization},
  author = {Panagiotis Petsagkourakis and Ilya Orson Sandoval and Eric Bradford and Dongda Zhang and Ehecatl Antonio del Rio Chanona},
  journal= {arXiv preprint arXiv:1904.07292},
  year   = {2019}
}