用于批过程控制的双 actor 双延迟深度确定性策略梯度(TATD3)学习
系统与控制
2021-09-20 v2 系统与控制
摘要
由于批过程在批次内及批次间具有复杂的非线性动态和未达稳态的运行条件,其控制是一项困难任务。人们期望通过开发直接与过程交互并从经验中学习的控制策略来应对其中部分挑战。文献中近期的研究表明,在 actor-critic 强化学习(RL)框架中采用 actor 集成有助于改进策略。本研究提出一种 actor-critic 强化学习算法,即双 actor 双延迟深度确定性策略梯度(TATD3),通过在已有的双延迟深度确定性策略梯度(TD3)算法中引入双 actor 网络以实现连续控制。此外,还为 TATD3 控制器提出了两类新型奖励函数。我们通过将其与文献中若干现有 RL 算法进行比较,展示了基于 TATD3 的控制器在多种批过程实例中的有效性。
引用
@article{arxiv.2102.13012,
title = {Twin actor twin delayed deep deterministic policy gradient (TATD3) learning for batch process control},
author = {Tanuja Joshi and Shikhar Makker and Hariprasad Kodamana and Harikumar Kandath},
journal= {arXiv preprint arXiv:2102.13012},
year = {2021}
}
备注
12 pages