中文

基于迟滞的强化学习:通过混合控制增强基于强化学习的控制策略的鲁棒性

机器学习 2022-04-05 v1 人工智能 系统与控制 系统与控制

摘要

强化学习(RL)是一种用于推导复杂系统控制策略的有前景的方法。正如我们在两个控制问题中展示的,使用近端策略优化(PPO)和深度Q网络(DQN)算法推导出的策略可能缺乏鲁棒性保证。受这些问题的启发,我们提出了一种称为基于迟滞的强化学习(HyRL)的新混合算法,通过迟滞切换和两阶段学习来增强现有的RL算法。我们在PPO和DQN失败的两个例子中说明了其特性。

关键词

引用

@article{arxiv.2204.00654,
  title  = {Hysteresis-Based RL: Robustifying Reinforcement Learning-based Control Policies via Hybrid Control},
  author = {Jan de Priester and Ricardo G. Sanfelice and Nathan van de Wouw},
  journal= {arXiv preprint arXiv:2204.00654},
  year   = {2022}
}

备注

This paper has been accepted for publication at the 2022 American Control Conference (ACC)