深度后继强化学习
机器学习
2016-06-09 v1 人工智能
机器学习
神经与进化计算
摘要
借助无模型和基于模型的深度强化学习算法,现在已能从原始观测和奖励中学习鲁棒的价值函数。还有第三种替代方案,称为后继表征(SR),它将价值函数分解为两个组件——奖励预测器和后继映射。后继映射表示从任意给定状态出发的预期未来状态占据情况,而奖励预测器将状态映射为标量奖励。一个状态的价值函数可以计算为后继映射与奖励权重之间的内积。在本文中,我们提出了 DSR,它在一个端到端的深度强化学习框架内推广了 SR。DSR 具有几个吸引人的特性,包括:由于奖励与世界动力学的分解,对远端奖励变化的敏感性增加;以及在随机策略下训练的后继映射具有提取瓶颈状态(子目标)的能力。我们在给定原始像素观测的两个不同环境——简单网格世界域(MazeBase)和 Doom 游戏引擎——上展示了我们方法的有效性。
引用
@article{arxiv.1606.02396,
title = {Deep Successor Reinforcement Learning},
author = {Tejas D. Kulkarni and Ardavan Saeedi and Simanta Gautam and Samuel J. Gershman},
journal= {arXiv preprint arXiv:1606.02396},
year = {2016}
}
备注
10 pages, 6 figures