中文

表示策略迭代

人工智能 2012-07-09 v1

摘要

本文解决了一个对于求解大型马尔可夫决策过程(MDPs)的近似方法至关重要的基本问题:如何自动学习值函数近似的基础表示?我们提出了一种新颖且理论严谨的框架,该框架能自动生成几何定制的规范正交基函数集,可与任何近似 MDP 求解器(如最小二乘策略迭代 LSPI)配合使用。关键创新在于利用黎曼流形上的光滑函数理论,实现了值函数的无坐标表示。Hodge 理论提供了一种构造性方法,基于流形上自伴(Laplace-Beltrami)算子的特征函数生成用于近似值函数的基函数。实际上,该方法在状态空间图上执行全局傅里叶分析以近似值函数,其中基函数反映了底层状态空间的大尺度拓扑结构。我们提出了一类称为表示策略迭代(RPI)的新算法,能够自动学习基函数和近似最优策略。说明性实验比较了 RPI 与使用两种手工编码基函数(RBF 和多项式状态编码)的 LSPI 的性能。

关键词

引用

@article{arxiv.1207.1408,
  title  = {Representation Policy Iteration},
  author = {Sridhar Mahadevan},
  journal= {arXiv preprint arXiv:1207.1408},
  year   = {2012}
}

备注

Appears in Proceedings of the Twenty-First Conference on Uncertainty in Artificial Intelligence (UAI2005)