中文

神经动力学中行为序列的自主强化

神经与进化计算 2013-05-15 v2

摘要

我们引入了一种名为动态神经 (DN) SARSA(λ\lambda) 的动态神经算法,用于从延迟奖励中学习行为序列。DN-SARSA(λ\lambda) 结合了行为序列表示的动态场理论模型、经典强化学习以及一种称为项与序工作记忆的计算神经科学工作记忆模型,后者充当资格迹。DN-SARSA(λ\lambda) 已在模拟机器人和真实机器人上实现,这些机器人必须通过探索学习特定的奖励性基本行为序列。结果表明,DN-SARSA(λ\lambda) 的性能达到了离散 SARSA(λ\lambda) 的水平,验证了在不损害神经动力学的情况下进行通用强化学习的可行性。

关键词

引用

@article{arxiv.1210.3569,
  title  = {Autonomous Reinforcement of Behavioral Sequences in Neural Dynamics},
  author = {Sohrob Kazerounian and Matthew Luciw and Mathis Richter and Yulia Sandamirskaya},
  journal= {arXiv preprint arXiv:1210.3569},
  year   = {2013}
}

备注

Sohrob Kazerounian, Matthew Luciw are Joint first authors