最优无偏价值估计量及其与LSTD、TD和MC的关系
机器学习
2009-08-25 v1 统计理论
统计理论
摘要
在这项分析研究中,我们推导了最优无偏价值估计量(MVU),并将其统计风险与三种著名的价值估计量进行了比较:时序差分学习(TD)、蒙特卡洛估计(MC)和最小二乘时序差分学习(LSTD)。我们证明了如果马尔可夫奖励过程(MRP)是无环的,则LSTD等价于MVU,并表明对于大多数有环MRP,两者不同,因为此时LSTD通常是有偏的。更一般地,我们表明满足贝尔曼方程的估计量只能对特殊的有环MRP是无偏的。主要原因在于计算期望所用的概率测度。这些测度在不同状态间变化,并且由于贝尔曼方程的强耦合,一组价值估计量通常不可能相对于每个测度都是无偏的。此外,我们推导了MVU与MC和TD的关系。其中最重要的是,对于无折扣的MRP,当MC拥有相同信息量时,MC等价于MVU和LSTD。在折扣情况下,这种等价关系不再成立。对于TD,我们表明它在无环MRP中本质上无偏,而在有环MRP中有偏。我们还根据风险对估计量进行排序,并给出反例以表明MVU与LSTD之间、MC与LSTD之间以及TD与MC之间不存在一般的排序关系。理论结果得到了实例和实证评估的支持。
引用
@article{arxiv.0908.3458,
title = {The Optimal Unbiased Value Estimator and its Relation to LSTD, TD and MC},
author = {Steffen Grünewälder and Klaus Obermayer},
journal= {arXiv preprint arXiv:0908.3458},
year = {2009}
}
备注
Final version is under review. 38 pages, 8 figures