中文

基于动态在线 k-means 的内存高效情景控制强化学习

机器学习 2019-11-22 v1 神经与进化计算 机器学习

摘要

近来,受神经科学启发的情景控制(EC)方法被提出以克服标准深度强化学习方法的数据低效问题。它们使用非参数/半参数模型来估计价值函数,通过检索相似过去状态的缓存值实现快速学习。在资源有限且数据含噪的现实场景中,在内存中维持有意义的表征对于加速学习并避免灾难性遗忘至关重要。遗憾的是,EC 方法具有较大的空间与时间复杂度。我们基于存储状态的优先级排序与排名以及在线聚类技术,研究了解决这些问题的不同方案。我们还提出了一种新的动态在线 k-means 算法,该算法计算高效,并在更小内存规模下取得显著更优的性能;我们在经典强化学习环境与 Atari 游戏上验证了该方法。

关键词

引用

@article{arxiv.1911.09560,
  title  = {Memory-Efficient Episodic Control Reinforcement Learning with Dynamic Online k-means},
  author = {Andrea Agostinelli and Kai Arulkumaran and Marta Sarrico and Pierre Richemond and Anil Anthony Bharath},
  journal= {arXiv preprint arXiv:1911.09560},
  year   = {2019}
}

备注

Workshop on Biological and Artificial Reinforcement Learning, NeurIPS 2019