非平稳策略下近似修正策略迭代的紧性能界
最优化与控制
2013-04-23 v1 人工智能
摘要
我们考虑由马尔可夫决策过程形式化的无限时域平稳-折扣最优控制问题的近似动态规划。虽然在精确情况下已知总是存在一个平稳的最优策略,但我们表明,当使用值函数近似时,寻找非平稳策略可能会带来更好的性能保证。我们定义了一个非平稳的MPI变体,它统一了文献中一大类近似DP算法。对于该算法,我们提供了误差传播分析,以所得策略的性能界的形式给出,该性能界可以将通常的性能界改进倍,当折扣因子接近1时这很显著。通过这样做,我们的方法统一了值迭代和策略迭代的最新结果。此外,通过构造一个特定的确定性MDP,我们证明了我们的性能保证是紧的。
引用
@article{arxiv.1304.5610,
title = {Tight Performance Bounds for Approximate Modified Policy Iteration with Non-Stationary Policies},
author = {Boris Lesner and Bruno Scherrer},
journal= {arXiv preprint arXiv:1304.5610},
year = {2013}
}