原始-对偶 $\pi$ 学习:遍历 Markov 决策问题的样本复杂度与次线性运行时间
机器学习
2017-10-18 v1 计算复杂性
最优化与控制
摘要
考虑通过采样状态转移来近似 Markov 决策过程(MDP)最优策略的问题。与基于对非线性 Bellman 方程逐次近似的现有强化学习方法不同,鉴于值与策略之间的线性对偶性,我们提出了一种原始-对偶 学习方法。 学习方法是 model-free 的,并随着新数据的揭示对策略和值向量进行原始-对偶更新。对于具有有限状态空间 和有限动作空间 的无限时界无折扣 Markov 决策过程, 学习方法使用如下数量的样本转移找到一个 -最优策略 其中 是所有策略混合时间的上界, 是表征各策略平稳分布范围的参数。 学习方法同样适用于转移概率和奖励作为输入显式给出的 MDP 计算问题。在每次状态转移可在 时间内采样的情况下, 学习方法给出了一种求解平均奖励 MDP 的次线性时间算法。
引用
@article{arxiv.1710.06100,
title = {Primal-Dual $\pi$ Learning: Sample Complexity and Sublinear Run Time for Ergodic Markov Decision Problems},
author = {Mengdi Wang},
journal= {arXiv preprint arXiv:1710.06100},
year = {2017}
}