分解 MDPs 的策略迭代
人工智能
2013-01-18 v1
摘要
许多大型 MDPs 可以使用动态贝叶斯网络进行紧凑表示。尽管值函数的结构并未保留过程的结构,但最近的工作表明,分解 MDPs 中的值函数通常可以使用分解值函数得到很好的近似:这是一种受限基函数的线性组合,每个基函数仅涉及一小部分变量。特定策略的近似值函数可以使用近似动态规划来计算,但这种方法(及其他方法)只能产生相对于由当前策略的平稳分布加权的距离度量的近似。这种加权投影不适合策略改进。我们提出了一种新的值确定方法,使用简单的闭式计算直接计算出值函数的最小二乘分解近似,适用于任意权重。然后,我们将此值确定算法作为策略迭代过程中的一个子程序。我们证明,在合理的限制下,由分解值函数导出的策略可以被紧凑表示,并能在策略迭代过程中被高效处理。我们还提出了一种使用用于函数优化的变量消元算法来计算分解值函数误差界限的方法。我们所有算法的复杂度均取决于系统动力学和近似值函数的分解结构。
引用
@article{arxiv.1301.3869,
title = {Policy Iteration for Factored MDPs},
author = {Daphne Koller and Ron Parr},
journal= {arXiv preprint arXiv:1301.3869},
year = {2013}
}
备注
Appears in Proceedings of the Sixteenth Conference on Uncertainty in Artificial Intelligence (UAI2000)