基于迟滞的强化学习:通过混合控制增强基于强化学习的控制策略的鲁棒性
机器学习
2022-04-05 v1 人工智能
系统与控制
系统与控制
摘要
强化学习(RL)是一种用于推导复杂系统控制策略的有前景的方法。正如我们在两个控制问题中展示的,使用近端策略优化(PPO)和深度Q网络(DQN)算法推导出的策略可能缺乏鲁棒性保证。受这些问题的启发,我们提出了一种称为基于迟滞的强化学习(HyRL)的新混合算法,通过迟滞切换和两阶段学习来增强现有的RL算法。我们在PPO和DQN失败的两个例子中说明了其特性。
引用
@article{arxiv.2204.00654,
title = {Hysteresis-Based RL: Robustifying Reinforcement Learning-based Control Policies via Hybrid Control},
author = {Jan de Priester and Ricardo G. Sanfelice and Nathan van de Wouw},
journal= {arXiv preprint arXiv:2204.00654},
year = {2022}
}
备注
This paper has been accepted for publication at the 2022 American Control Conference (ACC)