中文

线性可解马尔可夫决策过程中在线学习的快速收敛速率

机器学习 2017-06-07 v2 最优化与控制 机器学习

摘要

我们研究一类被称为线性可解 MDP 的马尔可夫决策过程中的在线学习问题。在该问题的平稳版本中,学习者通过直接控制状态转移与环境交互,试图在固定的状态相关成本与惩罚极端控制输入的某种平滑成本之间取得平衡。在本文中,我们考虑一种在线设定,其中状态成本可以在连续轮次之间任意变化,且学习者仅在每轮结束时观察到该轮的成本。我们感兴趣的是为学习者构造算法,以保证其相对于在完全已知成本序列下选出的最佳平稳控制策略具有较小的遗憾。我们的主要结果是证明控制成本的平滑性使得简单的跟随领导者算法在 TT 轮后能够实现 log2T\log^2 T 阶的遗憾,极大地改进了该设定下已知的 T3/4T^{3/4} 阶遗憾界。

关键词

引用

@article{arxiv.1702.06341,
  title  = {Fast rates for online learning in Linearly Solvable Markov Decision Processes},
  author = {Gergely Neu and Vicenç Gómez},
  journal= {arXiv preprint arXiv:1702.06341},
  year   = {2017}
}