用于基于模型的元强化学习的深度情景值迭代
机器学习
2017-05-11 v1 人工智能
机器学习
摘要
我们提出一种新的深度元强化学习器,称之为深度情景值迭代 (Deep Episodic Value Iteration, DEVI)。DEVI 使用深度神经网络为非参数基于模型的强化学习算法学习相似性度量。我们的模型通过反向传播进行端到端训练。尽管使用无模型 Q-learning 目标进行训练,我们表明 DEVI 的基于模型的内部结构提供对奖励和转移结构变化的一次性迁移,即使对于具有非常高维状态空间的任务也是如此。
引用
@article{arxiv.1705.03562,
title = {Deep Episodic Value Iteration for Model-based Meta-Reinforcement Learning},
author = {Steven Stenberg Hansen},
journal= {arXiv preprint arXiv:1705.03562},
year = {2017}
}