无模型情景控制
机器学习
2016-06-15 v1 机器学习
神经元与认知
摘要
当前最先进的深度强化学习算法需要数百万次交互才能达到人类水平的表现。然而,人类在首次发现环境时,就能非常迅速地利用环境中高回报的细微特征。在大脑中,这种快速学习被认为依赖于海马体及其情景记忆能力。本文研究海马体情景控制的一个简单模型是否能学习解决困难的序列决策任务。我们证明,它不仅比最先进的深度强化学习算法显著更快地获得高回报策略,而且在一些更具挑战性的领域上获得了更高的总体回报。
引用
@article{arxiv.1606.04460,
title = {Model-Free Episodic Control},
author = {Charles Blundell and Benigno Uria and Alexander Pritzel and Yazhe Li and Avraham Ruderman and Joel Z Leibo and Jack Rae and Daan Wierstra and Demis Hassabis},
journal= {arXiv preprint arXiv:1606.04460},
year = {2016}
}