TD 算法的统一视角:引入全梯度 TD 与等梯度下降 TD
机器学习
2007-05-23 v1
摘要
本文针对使用线性函数逼近的马尔可夫决策过程(MDP)中的策略评估问题,提供了诸如TD(lambda)、LSTD(lambda)、iLSTD、残差梯度TD等算法的统一视角。我们断言,这些算法都包含在最小化一个梯度函数的过程中,差别在于该函数的形式及其最小化方式。本文在此框架中引入两种新方案:全梯度 TD(Full-gradient TD),其使用iLSTD中引入的原则的一种推广;以及等梯度下降 TD(EGD TD),其通过 successive equi-gradient descents 对梯度进行降维。这三种算法构成一种新的中间族,其中具有将样本利用得更好、同时保持梯度下降方案的有趣属性,这对于复杂性问题和乐观策略迭代具有帮助。
引用
@article{arxiv.cs/0611145,
title = {A Unified View of TD Algorithms; Introducing Full-Gradient TD and Equi-Gradient Descent TD},
author = {Manuel Loth and Philippe Preux},
journal= {arXiv preprint arXiv:cs/0611145},
year = {2007}
}