基于可微分神经计算机仿真迭代式模型强化学习
机器学习
2019-06-19 v1 机器学习
摘要
我们提出了一种终身学习架构——神经计算机智能体(Neural Computer Agent, NCA),其中强化学习智能体与由可微分神经计算机(Differentiable Neural Computer, DNC)学习得到的环境预测模型相配对。智能体与 DNC 模型迭代地联合训练。智能体在 DNC 模型生成的仿真中改进其策略,并将策略部署到真实环境中,在环境的新部分或新任务中收集经验以进一步学习。在两个合成环境中的实验表明,DNC 模型能够持续仅从像素中学习,在智能体遇到新任务时对其进行仿真,而智能体可以利用近端策略优化(Proximal Policy Optimization)完全在仿真中成功训练以求解这些任务。
引用
@article{arxiv.1906.07248,
title = {Iterative Model-Based Reinforcement Learning Using Simulations in the Differentiable Neural Computer},
author = {Adeel Mufti and Svetlin Penkov and Subramanian Ramamoorthy},
journal= {arXiv preprint arXiv:1906.07248},
year = {2019}
}
备注
Accepted at the Workshop on Multi-Task and Lifelong Reinforcement Learning, 36th International Conference on Machine Learning, Long Beach, California, 2019