基于自适应 Q 学习的控制
机器学习
2020-11-05 v1
摘要
本文在两个经典控制问题(Pendulum 和 Cartpole)中评估了自适应 Q 学习(AQL)和单分区自适应 Q 学习(SPAQL)这两种用于高效无模型 episodic 强化学习(RL)的算法。AQL 在学习控制策略(即状态到动作的映射)的同时,自适应地划分马尔可夫决策过程(MDP)的状态-动作空间。AQL 与 SPAQL 的主要区别在于,后者学习时不变策略,其中状态到动作的映射不显式依赖于时间步。本文还提出了带终止状态的 SPAQL(SPAQL-TS),这是 SPAQL 的改进版本,专为控制问题调节器的设计而定制。研究表明,在所研究的两个问题中,时不变策略比时变策略具有更好的性能。这些算法特别适用于动作空间有限的 RL 问题,Cartpole 问题即为一例。SPAQL-TS 解决了 OpenAI Gym 的 Cartpole 问题,同时显示出比信任域策略优化(TRPO)更高的采样效率,而 TRPO 是解决控制任务的标准 RL 算法。此外,SPAQL 学习的策略是可解释的,而 TRPO 策略通常编码为神经网络,因此难以解释。在保持采样效率的同时产生可解释策略是 SPAQL 的主要优势。
引用
@article{arxiv.2011.02141,
title = {Control with adaptive Q-learning},
author = {João Pedro Araújo and Mário A. T. Figueiredo and Miguel Ayala Botto},
journal= {arXiv preprint arXiv:2011.02141},
year = {2020}
}
备注
29 pages, 13 figures. arXiv admin note: substantial text overlap with arXiv:2007.06741