随机原始对偶方法与强化学习的样本复杂度
机器学习
2016-12-09 v1 人工智能
最优化与控制
摘要
我们研究马尔可夫决策过程 (MDP) 最优策略的在线估计。我们提出一类随机原始对偶 (SPD) 方法,其利用了 Bellman 方程的固有极小极大对偶性。SPD 方法在新状态转移被观测到时更新价值与策略估计的少数坐标。这些方法使用小存储且每次迭代计算复杂度低。SPD 方法以高概率找到绝对 -最优策略,对于无限时域(infinite-horizon)折扣奖励 MDP 使用 次迭代/样本,对于有限时域(finite-horizon)MDP 使用 。
引用
@article{arxiv.1612.02516,
title = {Stochastic Primal-Dual Methods and Sample Complexity of Reinforcement Learning},
author = {Yichen Chen and Mengdi Wang},
journal= {arXiv preprint arXiv:1612.02516},
year = {2016}
}