神经情景控制
机器学习
2017-03-07 v1 机器学习
摘要
深度强化学习方法在众多环境中达到了超越人类的表现。然而,这类方法效率极低,通常需要比人类多出数个数量级的数据才能达到合理的性能。我们提出神经情景控制:一种能够快速吸收新经验并据此采取行动的深度强化学习智能体。我们的智能体采用价值函数的半表格表示:一个包含缓慢变化状态表示和快速更新价值函数估计的过往经验缓冲区。我们在广泛的环境范围内证明,我们的智能体学习速度显著快于其他最先进的通用深度强化学习智能体。
引用
@article{arxiv.1703.01988,
title = {Neural Episodic Control},
author = {Alexander Pritzel and Benigno Uria and Sriram Srinivasan and Adrià Puigdomènech and Oriol Vinyals and Demis Hassabis and Daan Wierstra and Charles Blundell},
journal= {arXiv preprint arXiv:1703.01988},
year = {2017}
}