基于神经网络的时序差分学习——泄漏传播问题研究
机器学习
2018-07-10 v1 机器学习
摘要
带函数逼近的时序差分学习(TD)[Sutton, 1988]可能收敛到比蒙特卡洛回归更差的解,即便在简单的在策略评估情形下亦然。为增进对该问题的理解,我们研究了值函数在尖锐不连续区域中的逼近误差被自助更新进一步传播的问题。我们给出了该泄漏传播的实证证据,并从解析上证明:在存在函数逼近误差的简单马尔可夫链中,它必然发生。对于可逆策略,该结果可解释为TD所最小化损失函数中两项的张力,正如[Ollivier, 2018]近期所述。我们表明[Tsitsiklis and Van Roy, 1997]的上界成立,但它们并不蕴含泄漏传播的发生及其条件。最后,我们检验了该问题能否通过更好的状态表示缓解,以及它能否以无监督方式、无需奖励或特权信息地学习。
引用
@article{arxiv.1807.03064,
title = {Temporal Difference Learning with Neural Networks - Study of the Leakage Propagation Problem},
author = {Hugo Penedones and Damien Vincent and Hartmut Maennel and Sylvain Gelly and Timothy Mann and Andre Barreto},
journal= {arXiv preprint arXiv:1807.03064},
year = {2018}
}