基于距离激励/惩罚(DIP)更新的强化学习用于高度约束的工业控制系统
人工智能
2021-05-20 v2 系统与控制
系统与控制
摘要
典型的强化学习(RL)方法对真实世界工业控制问题的适用性有限,因为工业系统涉及各种约束,且同时需要连续与离散控制。为克服这些挑战,我们设计了一种新颖的 RL 算法,使智能体能处理高度约束的动作空间。该算法有两个主要特征。首先,我们在基于距离的激励/惩罚更新技术中设计了两种基于距离的 Q 值更新方案,即激励更新与惩罚更新,以使智能体能在可行域内决定离散与连续动作,并更新这些类型动作的价值。其次,我们提出了一种将惩罚代价定义为影子价格加权惩罚的方法。与先前方法相比,该方法具有两个优势,可高效诱导智能体不选择不可行动作。我们将算法应用于工业控制问题——微电网系统运行,实验结果证明了其优越性。
引用
@article{arxiv.2011.10897,
title = {Reinforcement learning with distance-based incentive/penalty (DIP) updates for highly constrained industrial control systems},
author = {Hyungjun Park and Daiki Min and Jong-hyun Ryu and Dong Gu Choi},
journal= {arXiv preprint arXiv:2011.10897},
year = {2021}
}
备注
We request withdrawal of this article due to a definition error on methodology and problem definition (Section 3-4; pages 2-5)