广义Speedy Q-learning
机器学习
2020-02-14 v2 人工智能
摘要
在本文中,我们推导了强化学习(RL)文献中提出的Speedy Q-learning(SQL)算法的推广,该算法旨在处理Watkins的Q-learning收敛缓慢的问题。在诸如Q-learning的大多数RL算法中,Bellman方程与Bellman算子起着重要作用。利用逐次松弛技术可以推广Bellman算子。我们使用广义Bellman算子推导出一个简单而高效的算法族,称为广义Speedy Q-learning(GSQL-w),并分析了其有限时间性能。我们证明,当松弛参数w大于1时,GSQL-w相比SQL具有改进的有限时间性能界。这一改进是由于广义Bellman算子的压缩因子小于标准Bellman算子的压缩因子。文中给出了数值实验以展示GSQL-w算法的经验性能。
引用
@article{arxiv.1911.00397,
title = {Generalized Speedy Q-learning},
author = {Indu John and Chandramouli Kamanchi and Shalabh Bhatnagar},
journal= {arXiv preprint arXiv:1911.00397},
year = {2020}
}