中文

随机 Lipschitz Q-学习

机器学习 2019-07-11 v2 人工智能 最优化与控制 机器学习

摘要

在情节式马尔可夫决策过程(MDP)问题中,在线算法在长度为 HHHH 次试验序列中从一组动作里进行选择(HH 为情节长度),以最大化所选动作的总收益。Q-学习作为最流行的无模型强化学习(RL)算法,直接参数化并更新价值函数,而无需显式建模环境。近来,[Jin et al. 2018] 研究了具有有限状态与动作的 Q-学习的样本复杂度。其算法达到了近乎最优的遗憾值,表明 Q-学习可以做到样本高效。然而,具有大型离散状态与动作 [Silver et al. 2016] 或连续空间 [Mnih et al. 2013] 的 MDP 无法以此方式高效学习。因此,开发新算法以解决这一困境并对样本复杂度提供可证明保证至关重要。基于此动机,我们提出了一种适用于更一般设定下 MDP 的新算法,该设定具有无穷多状态与动作,并假设收益函数与转移核为 Lipschitz 连续。我们也给出了算法的相应理论依据。其达到的遗憾为 O~(Kd+1d+2H3)\tilde{\mathcal{O}}(K^{\frac{d+1}{d+2}}\sqrt{H^3}),其中 KK 表示情节数,dd 表示联合空间的维度。据我们所知,这是无模型设定下首个所建立遗憾值仅差对数因子即匹配下界的分析。

关键词

引用

@article{arxiv.1904.10653,
  title  = {Stochastic Lipschitz Q-Learning},
  author = {Xu Zhu},
  journal= {arXiv preprint arXiv:1904.10653},
  year   = {2019}
}

备注

The papers have been removed and we refer the readers to arXiv:1901.09277. arXiv admin note: author list truncated