最小二乘时序差分学习算法的性质
机器学习
2015-04-06 v2 机器学习
摘要
本文从四个不同视角考察了著名的最小二乘时序差分(LSTD)算法——用于计算马尔可夫奖励过程的价值函数——每个视角均带来不同洞见:基于Galerkin方法的算子理论视角、基于工具变量的统计视角、线性动力系统视角以及TD迭代的极限。我们还给出了该算法作为斜投影的几何视角。此外,将LSTD求解的优化问题与Bellman残差最小化(BRM)进行了广泛比较。随后回顾了LSTD解的几种正则化方案。最后,针对情景式马尔可夫奖励过程情形,讨论了LSTD的相应修改。
引用
@article{arxiv.1301.5220,
title = {Properties of the Least Squares Temporal Difference learning algorithm},
author = {Kamil Ciosek},
journal= {arXiv preprint arXiv:1301.5220},
year = {2015}
}