中文

克服神经价值近似中的谱偏置

机器学习 2022-06-10 v1 机器学习

摘要

使用深度神经网络进行价值近似是离策略深度强化学习的核心,并且通常是为算法其余部分提供学习信号的主要模块。虽然多层感知机网络是通用函数逼近器,但近期关于神经核回归的研究表明存在一种谱偏置,即拟合价值函数的高频分量所需的梯度更新步数相比低频分量呈指数级增长。在本工作中,我们通过核回归的视角重新审视离策略强化学习,并提出通过复合神经正切核来克服这种偏置。仅需一行代码改动,我们的方法——傅里叶特征网络(FFN)——仅以极少的计算量就在具有挑战性的连续控制领域取得了最先进的性能。更快的收敛和更好的离策略稳定性还使得可以在不出现灾难性发散的情况下移除目标网络,这进一步减少了 TD(0) 在少数任务上的估计偏置。

关键词

引用

@article{arxiv.2206.04672,
  title  = {Overcoming the Spectral Bias of Neural Value Approximation},
  author = {Ge Yang and Anurag Ajay and Pulkit Agrawal},
  journal= {arXiv preprint arXiv:2206.04672},
  year   = {2022}
}

备注

Code and analysis available at https://geyang.github.io/ffn . First two authors contributed equally