深度强化学习中用于迁移的状态空间分解与子目标创建
人工智能
2017-05-26 v1 机器学习
机器学习
摘要
典型的强化学习(RL)智能体学习完成由其领域定制的奖励函数所指定的任务。因此,它们学到的策略甚至无法泛化到相似的领域。为了解决这个问题,我们开发了一个框架,通过该框架,深度RL智能体使用循环注意力机制学习将策略从较小、较简单的领域泛化到更复杂的领域。任务以图像和指定目标的指令形式呈现给智能体。这个元控制器通过在注意力范围内的状态空间部分设计一系列较小的子任务,有效地对其进行分解,从而引导智能体朝向其目标。作为基线,我们也考虑了一个没有注意力的设置。我们的实验表明,元控制器学会了在注意力范围内创建子目标。
引用
@article{arxiv.1705.08997,
title = {State Space Decomposition and Subgoal Creation for Transfer in Deep Reinforcement Learning},
author = {Himanshu Sahni and Saurabh Kumar and Farhan Tejani and Yannick Schroecker and Charles Isbell},
journal= {arXiv preprint arXiv:1705.08997},
year = {2017}
}
备注
5 pages, 6 figures; 3rd Multidisciplinary Conference on Reinforcement Learning and Decision Making (RLDM 2017), Ann Arbor, Michigan