中文

随机原始对偶方法与强化学习的样本复杂度

机器学习 2016-12-09 v1 人工智能 最优化与控制

摘要

我们研究马尔可夫决策过程 (MDP) 最优策略的在线估计。我们提出一类随机原始对偶 (SPD) 方法,其利用了 Bellman 方程的固有极小极大对偶性。SPD 方法在新状态转移被观测到时更新价值与策略估计的少数坐标。这些方法使用小存储且每次迭代计算复杂度低。SPD 方法以高概率找到绝对 ϵ\epsilon-最优策略,对于无限时域(infinite-horizon)折扣奖励 MDP 使用 O(S4A2σ2(1γ)6ϵ2)\mathcal{O}\left(\frac{|\mathcal{S}|^4 |\mathcal{A}|^2\sigma^2 }{(1-\gamma)^6\epsilon^2} \right) 次迭代/样本,对于有限时域(finite-horizon)MDP 使用 O(S4A2H6σ2ϵ2)\mathcal{O}\left(\frac{|\mathcal{S}|^4 |\mathcal{A}|^2H^6\sigma^2 }{\epsilon^2} \right)

关键词

引用

@article{arxiv.1612.02516,
  title  = {Stochastic Primal-Dual Methods and Sample Complexity of Reinforcement Learning},
  author = {Yichen Chen and Mengdi Wang},
  journal= {arXiv preprint arXiv:1612.02516},
  year   = {2016}
}