中文

实时循环强化学习

机器学习 2025-04-17 v3 神经与进化计算 系统与控制 系统与控制

摘要

我们引入一种生物学上合理的RL框架,用于解决部分可观测马尔可夫决策过程(POMDPs)中的任务。所提算法结合三个组成部分:(1) 类哺乳动物基底神经节的元强化学习(Meta-RL)架构;(2) 生物学上合理的强化学习算法,利用时序差分学习与资格迹训练策略与值函数;(3) 在线自动微分算法,用于计算关于共享循环网络骨干参数的梯度。实验结果表明,该方法能够解决多种不同的部分可观测强化学习任务。我们称之为实时循环强化学习(RTRRL)的算法可作为生物神经网络中学习的模型,模拟基底神经节中的奖赏通路。

关键词

引用

@article{arxiv.2311.04830,
  title  = {Real-Time Recurrent Reinforcement Learning},
  author = {Julian Lemmel and Radu Grosu},
  journal= {arXiv preprint arXiv:2311.04830},
  year   = {2025}
}

备注

14 pages, 9 figures, includes Appendix