分层深度强化学习:融合时间抽象与内在动机
机器学习
2016-06-01 v2 人工智能
计算机视觉与模式识别
神经与进化计算
机器学习
摘要
在具有稀疏反馈的环境中学习目标导向行为,是强化学习算法面临的主要挑战。主要困难源于探索不足,导致智能体无法学习稳健的价值函数。内在动机驱动的智能体可以为其自身缘故探索新行为,而非直接解决问题。此类内在行为最终可帮助智能体解决环境所提出的任务。我们提出 hierarchical-DQN (h-DQN),一种将运行于不同时间尺度的分层价值函数与内在动机深度强化学习相集成的框架。顶层价值函数学习关于内在目标的策略,底层函数学习关于原子动作以满足给定目标的策略。h-DQN 允许灵活的目标规范,例如基于实体与关系的函数。这为在复杂环境中的探索提供了高效空间。我们在两个具有极稀疏、延迟反馈的问题上展示了方法的优势:(1) 一个复杂离散随机决策过程,以及 (2) 经典 ATARI 游戏 `Montezuma's Revenge`。
引用
@article{arxiv.1604.06057,
title = {Hierarchical Deep Reinforcement Learning: Integrating Temporal Abstraction and Intrinsic Motivation},
author = {Tejas D. Kulkarni and Karthik R. Narasimhan and Ardavan Saeedi and Joshua B. Tenenbaum},
journal= {arXiv preprint arXiv:1604.06057},
year = {2016}
}
备注
14 pages, 7 figures