基于非线性函数近似的高斯-牛顿时序差分学习
最优化与控制
2024-04-02 v2 机器学习
摘要
本文提出一种高斯-牛顿时序差分(GNTD)学习方法,以解决带非线性函数近似的Q-learning问题。在每次迭代中,我们的方法采取一步高斯-牛顿(GN)来优化一种均值平方贝尔曼误差(MSBE)的变体,其中采用目标网络以避免双重采样。我们对不精确GN步进行了分析,从而可通过廉价的矩阵迭代安全且高效地计算GN更新。在温和条件下,推导了针对不同非线性函数近似收敛至全局最优Q函数的非渐近有限样本收敛性。特别地,对于带relu激活的神经网络参数化,GNTD取得了的改进样本复杂度,而现有神经TD方法的样本复杂度为。对于一般光滑函数近似,GNTD的样本复杂度亦得以确立。我们在多个RL基准上通过大量实验验证了方法,其中GNTD相较TD类方法展现出更高回报与更快收敛。
引用
@article{arxiv.2302.13087,
title = {Gauss-Newton Temporal Difference Learning with Nonlinear Function Approximation},
author = {Zhifa Ke and Junyu Zhang and Zaiwen Wen},
journal= {arXiv preprint arXiv:2302.13087},
year = {2024}
}