HTMRL:基于层级时序记忆的生物学合理强化学习
机器学习
2020-09-21 v1 人工智能
机器学习
摘要
构建能够适应持续演化任务的强化学习(RL)算法是一个开放的研究挑战。层级时序记忆(HTM)是一种已知能固有地处理此类非平稳输入模式的技术,它是针对人类新皮层的一般且生物学合理的计算模型。由于 RL 范式受人类学习启发,HTM 是支持非平稳环境的 RL 算法的天然框架。在本文中,我们提出 HTMRL,首个严格基于 HTM 的 RL 算法。我们通过经验和统计表明,HTMRL 可扩展到大量状态和动作,并证明 HTM 适应变化模式的能力延伸至 RL。具体而言,HTMRL 在 750 步后于 10-臂老虎机表现良好,但仅需其三分之一步数即可适应老虎机突然打乱其臂。HTMRL 是一种新颖 RL 方法的首次迭代,具有扩展为可用于元强化学习(Meta-RL)算法的潜力。
引用
@article{arxiv.2009.08880,
title = {HTMRL: Biologically Plausible Reinforcement Learning with Hierarchical Temporal Memory},
author = {Jakob Struye and Kevin Mets and Steven Latré},
journal= {arXiv preprint arXiv:2009.08880},
year = {2020}
}