中文

基于可微分神经计算机仿真迭代式模型强化学习

机器学习 2019-06-19 v1 机器学习

摘要

我们提出了一种终身学习架构——神经计算机智能体(Neural Computer Agent, NCA),其中强化学习智能体与由可微分神经计算机(Differentiable Neural Computer, DNC)学习得到的环境预测模型相配对。智能体与 DNC 模型迭代地联合训练。智能体在 DNC 模型生成的仿真中改进其策略,并将策略部署到真实环境中,在环境的新部分或新任务中收集经验以进一步学习。在两个合成环境中的实验表明,DNC 模型能够持续仅从像素中学习,在智能体遇到新任务时对其进行仿真,而智能体可以利用近端策略优化(Proximal Policy Optimization)完全在仿真中成功训练以求解这些任务。

关键词

引用

@article{arxiv.1906.07248,
  title  = {Iterative Model-Based Reinforcement Learning Using Simulations in the Differentiable Neural Computer},
  author = {Adeel Mufti and Svetlin Penkov and Subramanian Ramamoorthy},
  journal= {arXiv preprint arXiv:1906.07248},
  year   = {2019}
}

备注

Accepted at the Workshop on Multi-Task and Lifelong Reinforcement Learning, 36th International Conference on Machine Learning, Long Beach, California, 2019