中文

持续探索学习策略的Robbins-Monro条件

机器学习 2018-10-12 v3 机器学习

摘要

我们提出了一些简单假设,蕴含了带有局部学习率的QQ学习算法的Robbins-Monro条件,该学习率依赖于特定状态-动作对被访问的次数(局部时钟)和迭代次数(全局时钟)。假设马尔可夫决策过程是可沟通的且学习策略确保持续探索。限制施加于学习率对局部和全局时钟的函数依赖上。该结果部分证实了Bradkte(1994)的猜想。

关键词

引用

@article{arxiv.1808.00245,
  title  = {Robbins-Monro conditions for persistent exploration learning strategies},
  author = {Dmitry B. Rokhlin},
  journal= {arXiv preprint arXiv:1808.00245},
  year   = {2018}
}

备注

9 pages, a typo in the title is corrected