持续探索学习策略的Robbins-Monro条件
机器学习
2018-10-12 v3 机器学习
摘要
我们提出了一些简单假设,蕴含了带有局部学习率的学习算法的Robbins-Monro条件,该学习率依赖于特定状态-动作对被访问的次数(局部时钟)和迭代次数(全局时钟)。假设马尔可夫决策过程是可沟通的且学习策略确保持续探索。限制施加于学习率对局部和全局时钟的函数依赖上。该结果部分证实了Bradkte(1994)的猜想。
引用
@article{arxiv.1808.00245,
title = {Robbins-Monro conditions for persistent exploration learning strategies},
author = {Dmitry B. Rokhlin},
journal= {arXiv preprint arXiv:1808.00245},
year = {2018}
}
备注
9 pages, a typo in the title is corrected