非线性时序差分学习收敛性的几何洞察
机器学习
2020-02-12 v4 最优化与控制
机器学习
摘要
尽管在使用线性函数逼近器时时序差分(TD)学习具有收敛性保证,但非线性模型的情况远未被充分理解,且已知存在发散实例。本文朝将理论收敛保证扩展至带非线性函数逼近的 TD 学习迈出了第一步。更确切地说,我们考虑用于价值估计的 TD(0) 算法的期望学习动态。当步长收敛到零时,这些动态由一个非线性 ODE 定义,该 ODE 依赖于函数逼近器空间的几何结构、底层马尔可夫链的结构以及它们之间的相互作用。我们找到了一类包含 ReLU 网络且无论环境如何都利于 TD 学习的函数逼近器,其几何性质使得该解在最坏情况下表现与线性 TD 相当。接着,我们展示了更具可逆性的环境如何诱导更利于 TD 学习的动态,并证明了对于良态函数逼近器能全局收敛到真实价值函数。最后,我们将一个发散反例推广到一类发散问题,以说明逼近器与环境之间的相互作用如何出错,并为证明收敛所需假设提供动机。
引用
@article{arxiv.1905.12185,
title = {Geometric Insights into the Convergence of Nonlinear TD Learning},
author = {David Brandfonbrener and Joan Bruna},
journal= {arXiv preprint arXiv:1905.12185},
year = {2020}
}
备注
ICLR 2020