实时循环强化学习
机器学习
2025-04-17 v3 神经与进化计算
系统与控制
系统与控制
摘要
我们引入一种生物学上合理的RL框架,用于解决部分可观测马尔可夫决策过程(POMDPs)中的任务。所提算法结合三个组成部分:(1) 类哺乳动物基底神经节的元强化学习(Meta-RL)架构;(2) 生物学上合理的强化学习算法,利用时序差分学习与资格迹训练策略与值函数;(3) 在线自动微分算法,用于计算关于共享循环网络骨干参数的梯度。实验结果表明,该方法能够解决多种不同的部分可观测强化学习任务。我们称之为实时循环强化学习(RTRRL)的算法可作为生物神经网络中学习的模型,模拟基底神经节中的奖赏通路。
引用
@article{arxiv.2311.04830,
title = {Real-Time Recurrent Reinforcement Learning},
author = {Julian Lemmel and Radu Grosu},
journal= {arXiv preprint arXiv:2311.04830},
year = {2025}
}
备注
14 pages, 9 figures, includes Appendix