中文

弥合目标网络与函数正则化之间的鸿沟

机器学习 2024-01-04 v2

摘要

自举(bootstrapping)是深度强化学习诸多成功背后的关键。然而,通过自举学习价值函数常因目标值快速变化而导致训练不稳定。目标网络(Target Networks)通过使用一组额外的滞后参数来估计目标值,从而稳定训练。尽管目标网络广受欢迎,其对于优化的影响仍被误解。在本工作中,我们表明它们充当一种隐式正则化器。该正则化器存在不灵活和非凸等缺点。为克服这些问题,我们提出一种显式函数正则化(Functional Regularization),它是函数空间中的凸正则化器且易于调参。我们从理论上分析了方法的收敛性,并经验性地证明用更具理论依据的函数正则化方法替代目标网络可带来更好的样本效率与性能提升。

关键词

引用

@article{arxiv.2210.12282,
  title  = {Bridging the Gap Between Target Networks and Functional Regularization},
  author = {Alexandre Piche and Valentin Thomas and Joseph Marino and Rafael Pardinas and Gian Maria Marconi and Christopher Pal and Mohammad Emtiyaz Khan},
  journal= {arXiv preprint arXiv:2210.12282},
  year   = {2024}
}

备注

The published version of this paper (TMLR 2023) is available at arXiv:2106.02613 and https://openreview.net/forum?id=BFvoemrmqX