无投影原始对偶方法学习马尔可夫决策过程混合策略的样本复杂度
机器学习
2019-09-02 v3 机器学习
摘要
我们研究具有大量状态的无限 horizon、折扣代价马尔可夫决策过程(MDP)的策略学习问题。我们计算一个策略的动作,该策略几乎与由合适 oracle 从给定混合策略类(由一组已知基策略的凸包刻画)中选出的策略一样好。为学习混合模型的系数,我们将问题重述为 MDP 的近似线性规划(ALP)形式,其中特征向量对应于定义在状态-动作空间上基策略的占据测度。然后我们提出一种带 Bregman 散度的无投影随机原始对偶方法以求解所刻画的 ALP。此外,我们分析了所提随机算法的可能近似正确(PAC)样本复杂度,即达到近最优目标值所需的查询次数。我们还提出了一种改进算法,采用多面体约束采样用于平滑 ALP,其中对下界近似的限制被放宽。另外,我们将所提算法应用于排队问题,并与罚函数算法比较性能。数值结果表明,相较于罚函数方法,原始对偶方法在不同试验中实现了更好效率与低方差。
引用
@article{arxiv.1903.06727,
title = {On Sample Complexity of Projection-Free Primal-Dual Methods for Learning Mixture Policies in Markov Decision Processes},
author = {Masoud Badiei Khuzani and Varun Vasudevan and Hongyi Ren and Lei Xing},
journal= {arXiv preprint arXiv:1903.06727},
year = {2019}
}
备注
Manuscript accepted to 58th CDC, 31 pages, 2 figures