中文

原始-对偶 $\pi$ 学习:遍历 Markov 决策问题的样本复杂度与次线性运行时间

机器学习 2017-10-18 v1 计算复杂性 最优化与控制

摘要

考虑通过采样状态转移来近似 Markov 决策过程(MDP)最优策略的问题。与基于对非线性 Bellman 方程逐次近似的现有强化学习方法不同,鉴于值与策略之间的线性对偶性,我们提出了一种原始-对偶 π\pi 学习方法。π\pi 学习方法是 model-free 的,并随着新数据的揭示对策略和值向量进行原始-对偶更新。对于具有有限状态空间 SS 和有限动作空间 AA 的无限时界无折扣 Markov 决策过程,π\pi 学习方法使用如下数量的样本转移找到一个 ϵ\epsilon-最优策略 O~((τtmix)2SAϵ2), \tilde{O}( \frac{(\tau\cdot t^*_{mix})^2 |S| |A| }{\epsilon^2} ), 其中 tmixt^*_{mix} 是所有策略混合时间的上界,τ\tau 是表征各策略平稳分布范围的参数。π\pi 学习方法同样适用于转移概率和奖励作为输入显式给出的 MDP 计算问题。在每次状态转移可在 O~(1)\tilde{O}(1) 时间内采样的情况下,π\pi 学习方法给出了一种求解平均奖励 MDP 的次线性时间算法。

关键词

引用

@article{arxiv.1710.06100,
  title  = {Primal-Dual $\pi$ Learning: Sample Complexity and Sublinear Run Time for Ergodic Markov Decision Problems},
  author = {Mengdi Wang},
  journal= {arXiv preprint arXiv:1710.06100},
  year   = {2017}
}