中文

RL 感知机:高维中策略学习的泛化动力学

机器学习 2025-10-02 v6 无序系统与神经网络

摘要

强化学习(RL)算法已在一系列领域中证明具有变革性。为处理真实世界领域,这些系统常使用神经网络直接从像素或其他高维感官输入学习策略。相比之下,许多 RL 理论聚焦于离散状态空间或最坏情况分析,关于高维设置中策略学习的动力学仍存在基本问题。在此,我们提出一个可解的 RL 高维模型,可捕获多种学习协议,并将其典型动力学推导为一组合闭式常微分方程(ODE)。我们推导了学习率和任务难度的最优调度——类似于 RL 训练中的退火方案和课程——并表明该模型展现出丰富行为,包括稀疏奖励下的延迟学习;依赖于奖励基线的多种学习机制;以及由奖励严格性驱动的精度-速度权衡。在 Procgen 游戏“Bossfight”变体和街机学习环境游戏“Pong”上的实验也实践性地展示了此种精度-速度权衡。总之,这些结果向缩小高维 RL 中理论与实践鸿沟迈出了一步。

关键词

引用

@article{arxiv.2306.10404,
  title  = {The RL Perceptron: Generalisation Dynamics of Policy Learning in High Dimensions},
  author = {Nishil Patel and Sebastian Lee and Stefano Sarao Mannelli and Sebastian Goldt and Andrew Saxe},
  journal= {arXiv preprint arXiv:2306.10404},
  year   = {2025}
}

备注

11 pages, 8 figures, Submitted to Physical Review X