带非线性函数近似的时序差分学习:懒惰训练与平均场机制
机器学习
2024-02-05 v5 机器学习
摘要
我们讨论用时序差分(TD)学习算法训练的非线性函数对无限 horizon 折扣马尔可夫奖励过程(MRP)值函数的逼近。我们首先在逼近函数的某种缩放下考虑此问题,导致一种称为懒惰训练的机制。在此机制中,模型参数在学习过程中仅轻微变化,这一特征最近在神经网络训练中被观察到,我们所研究的缩放在其参数初始化中自然隐含出现。无论在欠参数化还是过参数化框架下,我们均证明了上述算法在懒惰训练机制下指数收敛到局部(分别对应全局)极小点。然后我们将此参数缩放与平均场机制进行比较,后者中模型近似线性的行为丧失。在此替代缩放下,我们证明参数空间中动力学的所有不动点均为全局极小点。最后,我们给出了收敛结果的例子,涉及用非懒惰 TD 学习训练会发散的模型,以及神经网络的情形。
引用
@article{arxiv.1905.10917,
title = {Temporal-difference learning with nonlinear function approximation: lazy training and mean field regimes},
author = {Andrea Agazzi and Jianfeng Lu},
journal= {arXiv preprint arXiv:1905.10917},
year = {2024}
}
备注
accepted version to MSML 2021