中文

λ策略迭代的性能界及其在俄罗斯方块游戏中的应用

人工智能 2015-03-13 v5 机器人学

摘要

我们考虑由马尔可夫决策过程(Markov Decision Processes)形式化的离散时间无限视界最优控制问题。我们重访了 Bertsekas 和 Ioffe 的工作,他们引入了 λ\lambda 策略迭代(λ\lambda Policy Iteration),这是一类由 λ\lambda 参数化的算法族,推广了标准的值迭代(Value Iteration)和策略迭代(Policy Iteration)算法,并与 Sutton 和 Barto 描述的时序差分算法 TD(λ\lambda) 有着深刻的联系。通过提供推广了 Puterman 所描述的标准值迭代界的收敛速率界,我们深化了原作者发展的理论。本文的主要贡献是发展了该算法在近似形式下使用的理论,并证明其是健全的。借此,我们扩展并统一了 Munos 为近似值迭代和近似策略迭代分别开发的分析。最后,我们重访了该算法在训练俄罗斯方块游戏控制器中的应用,正如 Bertsekas 和 Ioffe 最初所做的那样。我们提供了一个可应用于此类无折扣控制问题的原创性能界。我们的实证结果与 Bertsekas 和 Ioffe 的结果不同(后者最初被定性为“悖论性”和“令人好奇的”),而更符合人们对学习实验的预期。我们讨论了造成这种差异的可能原因。

关键词

引用

@article{arxiv.0711.0694,
  title  = {Performance Bounds for Lambda Policy Iteration and Application to the Game of Tetris},
  author = {Bruno Scherrer},
  journal= {arXiv preprint arXiv:0711.0694},
  year   = {2015}
}

备注

No. RR-6348 (2011)