中文

弥合目标网络与函数正则化之间的鸿沟

机器学习 2023-09-08 v4 机器学习

摘要

自举(bootstrapping)是深度强化学习诸多成功背后的关键。然而,通过自举学习价值函数常因目标值快速变化而导致训练不稳定。目标网络(Target Networks)通过使用一组额外的滞后参数来估计目标值,从而稳定训练。尽管目标网络广受欢迎,其对优化的影响仍未被充分理解。本工作中,我们表明它们充当一种隐式正则化器,在某些情况下有益,但也存在缺点,如缺乏灵活性并可能导致不稳定,即便在vanilla TD(0)收敛时亦然。为克服这些问题,我们提出一种显式的函数正则化(Functional Regularization)替代方案,该方案灵活且为函数空间中的凸正则化器,并从理论上研究了其收敛性。我们在一系列环境、折扣因子和离策略(off-policiness)数据收集上进行了实验研究,以考察目标网络和函数正则化在性能、准确性和稳定性方面所引入正则化的有效性。我们的发现强调,函数正则化可作为目标网络的直接替代并带来性能提升。此外,在函数正则化中同时调整正则化权重和网络更新周期,相比通常目标网络仅调整网络更新周期,可带来进一步的性能改进。我们的方法还增强了网络恢复准确QQ值的能力。

关键词

引用

@article{arxiv.2106.02613,
  title  = {Bridging the Gap Between Target Networks and Functional Regularization},
  author = {Alexandre Piché and Valentin Thomas and Rafael Pardinas and Joseph Marino and Gian Maria Marconi and Christopher Pal and Mohammad Emtiyaz Khan},
  journal= {arXiv preprint arXiv:2106.02613},
  year   = {2023}
}

备注

The first two authors contributed equally