一种新颖的熵最大化TD3强化学习用于自动PID整定
系统与控制
2022-10-06 v1 系统与控制
摘要
比例—积分—微分(PID)控制器已广泛应用于过程工业。然而,PID 控制器的满意控制性能强烈依赖于整定参数。传统 PID 整定方法需要大量的系统模型知识,而这些知识并非总是已知,尤其在复杂动力系统情形下。相比之下,基于强化学习的 PID 整定已受到关注,因为它可将 PID 整定视为黑盒问题,并在无需显式过程模型的情况下给出最优 PID 参数。在本文中,我们提出一种新颖的熵最大化双延迟深度确定性策略梯度(EMTD3)方法用于自动化 PID 整定。在所提方法中,起初采用熵最大化随机 actor 以鼓励对动作空间的探索。随后部署确定性 actor 以专注于局部利用并发现最优解。熵最大化项的引入可显著提升样本效率并有助于快速收敛至全局解。我们所提方法应用于二阶系统的 PID 整定,以验证其在提升样本效率与发现最优 PID 参数方面相对于传统 TD3 的有效性。
引用
@article{arxiv.2210.02381,
title = {A Novel Entropy-Maximizing TD3-based Reinforcement Learning for Automatic PID Tuning},
author = {Myisha A. Chowdhury and Qiugang Lu},
journal= {arXiv preprint arXiv:2210.02381},
year = {2022}
}
备注
6 pages, 7 figures