通过深度后继表示进行本征选项发现
机器学习
2018-02-27 v3 人工智能
摘要
强化学习中的选项允许智能体将任务分层分解为子任务,具有加速学习与规划的潜力。然而,自主学习教育有效的选项集仍是该领域的一大挑战。本文聚焦于近期提出的利用表示学习方法来指导选项发现过程的思路。具体而言,我们研究本征选项,即由编码环境中扩散信息流的表示所获得的选项。我们将现有的本征选项发现算法扩展至具有随机转移且无法获得手工特征的环境。我们提出了一种在从原始像素学习非线性状态表示的同时发现本征选项的算法。它利用了深度强化学习文献中的近期成果以及原型值函数与后继表示之间的等价性。我们使用传统的表格域来提供对该方法的直观理解,并用 Atari 2600 游戏展示其潜力。
引用
@article{arxiv.1710.11089,
title = {Eigenoption Discovery through the Deep Successor Representation},
author = {Marlos C. Machado and Clemens Rosenbaum and Xiaoxiao Guo and Miao Liu and Gerald Tesauro and Murray Campbell},
journal= {arXiv preprint arXiv:1710.11089},
year = {2018}
}
备注
Published as a conference paper at ICLR 2018