中文

稀疏奖励确定性MDP的无记忆精确解

机器学习 2018-05-21 v1 机器学习

摘要

我们提出了一种针对具有稀疏奖励的确定性连续马尔可夫决策过程(MDP)的算法,该算法精确计算最优策略,且不依赖于状态空间的大小。算法的时间复杂度为 O(R3×A2)O( |R|^3 \times |A|^2 ),空间复杂度为 O(R×A)O( |R| \times |A| ),其中 R|R| 为奖励源数量,A|A| 为动作数量。此外,我们描述了一种配套算法,它可以在不计算整个值函数的情况下从任意初始状态遵循最优策略,而是按需计算所需状态的值。求解MDP的算法在时间与空间复杂度上均不依赖于状态空间大小,而遵循最优策略的能力在时间与空间上随从初始状态遵循最优策略的路径长度呈线性。我们在可处理的MDP上与值迭代并列演示了算法的运行。

关键词

引用

@article{arxiv.1805.07220,
  title  = {Memoryless Exact Solutions for Deterministic MDPs with Sparse Rewards},
  author = {Joshua R. Bertram and Peng Wei},
  journal= {arXiv preprint arXiv:1805.07220},
  year   = {2018}
}

备注

Submitted to NIPS 2018. arXiv admin note: text overlap with arXiv:1805.02785