中文

AsyncQVI:面向折扣马尔可夫决策过程的异步并行 Q 值迭代及其近最优样本复杂度

最优化与控制 2020-02-25 v3 机器学习

摘要

在本文中,我们提出 AsyncQVI,一种面向折扣马尔可夫决策过程的异步并行 Q 值迭代方法,其转移和奖励只能通过生成模型进行采样。给定具有 S|\mathcal{S}| 个状态、A|\mathcal{A}| 个动作以及折扣因子 γ(0,1)\gamma\in(0,1) 的此类问题,AsyncQVI 使用 O(S)\mathcal{O}(|\mathcal{S}|) 大小的内存,并利用 O~(SA(1γ)5ε2log(1δ))\tilde{\mathcal{O}}\big(\frac{|\mathcal{S}||\mathcal{A}|}{(1-\gamma)^5\varepsilon^2}\log(\frac{1}{\delta})\big) 个样本以至少 1δ1-\delta 的概率返回一个 ε\varepsilon-最优策略。AsyncQVI 也是首个用于折扣马尔可夫决策过程的异步并行算法,其样本复杂度几乎匹配理论下界。相对较低的内存占用和并行能力使 AsyncQVI 适用于大规模应用。在数值测试中,我们将 AsyncQVI 与四种基于采样的价值迭代方法进行比较。结果表明我们的算法高效且实现了线性并行加速。

关键词

引用

@article{arxiv.1812.00885,
  title  = {AsyncQVI: Asynchronous-Parallel Q-Value Iteration for Discounted Markov Decision Processes with Near-Optimal Sample Complexity},
  author = {Yibo Zeng and Fei Feng and Wotao Yin},
  journal= {arXiv preprint arXiv:1812.00885},
  year   = {2020}
}

备注

Accepted by AISTATS 2020