一种混合PAC强化学习算法
机器学习
2021-01-29 v2 机器学习
摘要
本文提出一种用于马尔可夫决策过程(MDPs)的新型混合可能近似正确(PAC)强化学习(RL)算法,其智能地保留了父算法的优良特性。所设计的算法称为Dyna-Delayed Q-learning(DDQ)算法,结合了无模型与基于模型的学习方法,且在多数情况下优于二者。本文包含对DDQ算法的PAC分析及其样本复杂度的推导。数值结果支持了新算法相较其父算法及已知最优无模型与基于模型算法在应用中更具样本效率的论断。
引用
@article{arxiv.2009.02602,
title = {A Hybrid PAC Reinforcement Learning Algorithm},
author = {Ashkan Zehfroosh and Herbert G. Tanner},
journal= {arXiv preprint arXiv:2009.02602},
year = {2021}
}