中文

随机最短路径问题下乐观策略迭代的收敛性

机器学习 2018-08-31 v2 机器学习

摘要

本文证明了随机最短路径问题的乐观策略迭代算法一种特殊情形的若干收敛结果。我们考虑在终止状态最终几乎必然可达的条件下,策略评估步骤采用蒙特卡洛与 TD(λ)TD(\lambda) 方法。

关键词

引用

@article{arxiv.1808.08763,
  title  = {On the convergence of optimistic policy iteration for stochastic shortest path problem},
  author = {Yuanlong Chen},
  journal= {arXiv preprint arXiv:1808.08763},
  year   = {2018}
}

备注

13 pages