序列记忆提升情景控制中的样本与记忆效率
机器学习
2024-06-07 v2 人工智能
机器人学
神经元与认知
摘要
最先进的深度强化学习算法由于需要大量回合才能达到渐近性能而样本效率低下。受哺乳动物海马体启发的情景强化学习(ERL)算法,通常使用扩展记忆系统从过去事件中引导学习,以克服这一样本低效问题。然而,此类记忆增强常被仅用作缓冲器,从中抽取孤立的过去经验以离线方式学习(例如回放)。在此,我们证明在所获记忆内容中引入源于情景采样顺序的偏置,可改善情景控制算法的样本与记忆效率。我们在一个觅食任务中测试我们的序列情景控制(SEC)模型,表明与仅缓冲孤立事件的标准 ERL 基准——无模型情景控制——相比,将集成片段作为事件序列存储和使用能以更少记忆需求实现更快学习。我们还研究了记忆约束与遗忘对 SEC 算法的序列与非序列版本的影响。此外,我们讨论了类海马快速记忆系统如何引导哺乳动物大脑中服务于习惯形成的缓慢皮层与皮层下学习。
引用
@article{arxiv.2112.14734,
title = {Sequential memory improves sample and memory efficiency in Episodic Control},
author = {Ismael T. Freire and Adrián F. Amil and Paul F. M. J. Verschure},
journal= {arXiv preprint arXiv:2112.14734},
year = {2024}
}
备注
21 pages, 8 figures