中文

非平稳策略下近似修正策略迭代的紧性能界

最优化与控制 2013-04-23 v1 人工智能

摘要

我们考虑由马尔可夫决策过程形式化的无限时域平稳γ\gamma-折扣最优控制问题的近似动态规划。虽然在精确情况下已知总是存在一个平稳的最优策略,但我们表明,当使用值函数近似时,寻找非平稳策略可能会带来更好的性能保证。我们定义了一个非平稳的MPI变体,它统一了文献中一大类近似DP算法。对于该算法,我们提供了误差传播分析,以所得策略的性能界的形式给出,该性能界可以将通常的性能界改进O(1γ)O(1-\gamma)倍,当折扣因子γ\gamma接近1时这很显著。通过这样做,我们的方法统一了值迭代和策略迭代的最新结果。此外,通过构造一个特定的确定性MDP,我们证明了我们的性能保证是紧的。

关键词

引用

@article{arxiv.1304.5610,
  title  = {Tight Performance Bounds for Approximate Modified Policy Iteration with Non-Stationary Policies},
  author = {Boris Lesner and Bruno Scherrer},
  journal= {arXiv preprint arXiv:1304.5610},
  year   = {2013}
}