中文

广义Speedy Q-learning

机器学习 2020-02-14 v2 人工智能

摘要

在本文中,我们推导了强化学习(RL)文献中提出的Speedy Q-learning(SQL)算法的推广,该算法旨在处理Watkins的Q-learning收敛缓慢的问题。在诸如Q-learning的大多数RL算法中,Bellman方程与Bellman算子起着重要作用。利用逐次松弛技术可以推广Bellman算子。我们使用广义Bellman算子推导出一个简单而高效的算法族,称为广义Speedy Q-learning(GSQL-w),并分析了其有限时间性能。我们证明,当松弛参数w大于1时,GSQL-w相比SQL具有改进的有限时间性能界。这一改进是由于广义Bellman算子的压缩因子小于标准Bellman算子的压缩因子。文中给出了数值实验以展示GSQL-w算法的经验性能。

关键词

引用

@article{arxiv.1911.00397,
  title  = {Generalized Speedy Q-learning},
  author = {Indu John and Chandramouli Kamanchi and Shalabh Bhatnagar},
  journal= {arXiv preprint arXiv:1911.00397},
  year   = {2020}
}