中文

非线性时序差分学习收敛性的几何洞察

机器学习 2020-02-12 v4 最优化与控制 机器学习

摘要

尽管在使用线性函数逼近器时时序差分(TD)学习具有收敛性保证,但非线性模型的情况远未被充分理解,且已知存在发散实例。本文朝将理论收敛保证扩展至带非线性函数逼近的 TD 学习迈出了第一步。更确切地说,我们考虑用于价值估计的 TD(0) 算法的期望学习动态。当步长收敛到零时,这些动态由一个非线性 ODE 定义,该 ODE 依赖于函数逼近器空间的几何结构、底层马尔可夫链的结构以及它们之间的相互作用。我们找到了一类包含 ReLU 网络且无论环境如何都利于 TD 学习的函数逼近器,其几何性质使得该解在最坏情况下表现与线性 TD 相当。接着,我们展示了更具可逆性的环境如何诱导更利于 TD 学习的动态,并证明了对于良态函数逼近器能全局收敛到真实价值函数。最后,我们将一个发散反例推广到一类发散问题,以说明逼近器与环境之间的相互作用如何出错,并为证明收敛所需假设提供动机。

关键词

引用

@article{arxiv.1905.12185,
  title  = {Geometric Insights into the Convergence of Nonlinear TD Learning},
  author = {David Brandfonbrener and Joan Bruna},
  journal= {arXiv preprint arXiv:1905.12185},
  year   = {2020}
}

备注

ICLR 2020