AsyncQVI:面向折扣马尔可夫决策过程的异步并行 Q 值迭代及其近最优样本复杂度
最优化与控制
2020-02-25 v3 机器学习
摘要
在本文中,我们提出 AsyncQVI,一种面向折扣马尔可夫决策过程的异步并行 Q 值迭代方法,其转移和奖励只能通过生成模型进行采样。给定具有 个状态、 个动作以及折扣因子 的此类问题,AsyncQVI 使用 大小的内存,并利用 个样本以至少 的概率返回一个 -最优策略。AsyncQVI 也是首个用于折扣马尔可夫决策过程的异步并行算法,其样本复杂度几乎匹配理论下界。相对较低的内存占用和并行能力使 AsyncQVI 适用于大规模应用。在数值测试中,我们将 AsyncQVI 与四种基于采样的价值迭代方法进行比较。结果表明我们的算法高效且实现了线性并行加速。
引用
@article{arxiv.1812.00885,
title = {AsyncQVI: Asynchronous-Parallel Q-Value Iteration for Discounted Markov Decision Processes with Near-Optimal Sample Complexity},
author = {Yibo Zeng and Fei Feng and Wotao Yin},
journal= {arXiv preprint arXiv:1812.00885},
year = {2020}
}
备注
Accepted by AISTATS 2020