中文

度量空间中情节式强化学习的自适应离散化

机器学习 2019-12-20 v2 机器学习

摘要

我们提出了一种高效的算法,用于大(可能是连续的)状态-动作空间中的无模型情节式强化学习。我们的算法基于一种新颖的具有自适应数据驱动离散化的 QQ-学习策略。核心思想是:在历史上频繁访问且 payoff 估计值更高的区域,维持更细的状态-动作空间划分。我们展示了自适应划分如何利用最优 QQ-函数与联合空间的形状,而不牺牲最坏情况性能。特别地,我们恢复了先前针对连续状态-动作空间算法的后悔保证,而那些算法还需将最优离散化作为输入和/或访问模拟预言机。此外,实验表明我们的算法如何自动适应问题的底层结构,相较于启发式方法和使用均匀离散化的 QQ-学习,获得了好得多的性能。

关键词

引用

@article{arxiv.1910.08151,
  title  = {Adaptive Discretization for Episodic Reinforcement Learning in Metric Spaces},
  author = {Sean R. Sinclair and Siddhartha Banerjee and Christina Lee Yu},
  journal= {arXiv preprint arXiv:1910.08151},
  year   = {2019}
}

备注

46 pages, 15 figures