中文

HTMRL:基于层级时序记忆的生物学合理强化学习

机器学习 2020-09-21 v1 人工智能 机器学习

摘要

构建能够适应持续演化任务的强化学习(RL)算法是一个开放的研究挑战。层级时序记忆(HTM)是一种已知能固有地处理此类非平稳输入模式的技术,它是针对人类新皮层的一般且生物学合理的计算模型。由于 RL 范式受人类学习启发,HTM 是支持非平稳环境的 RL 算法的天然框架。在本文中,我们提出 HTMRL,首个严格基于 HTM 的 RL 算法。我们通过经验和统计表明,HTMRL 可扩展到大量状态和动作,并证明 HTM 适应变化模式的能力延伸至 RL。具体而言,HTMRL 在 750 步后于 10-臂老虎机表现良好,但仅需其三分之一步数即可适应老虎机突然打乱其臂。HTMRL 是一种新颖 RL 方法的首次迭代,具有扩展为可用于元强化学习(Meta-RL)算法的潜力。

关键词

引用

@article{arxiv.2009.08880,
  title  = {HTMRL: Biologically Plausible Reinforcement Learning with Hierarchical Temporal Memory},
  author = {Jakob Struye and Kevin Mets and Steven Latré},
  journal= {arXiv preprint arXiv:2009.08880},
  year   = {2020}
}