面向复杂领域强化学习的探索式梯度提升
人工智能
2016-03-15 v1 机器学习
机器学习
摘要
高维观测和复杂真实世界动态在强化学习的函数逼近与探索方面带来了重大挑战。我们通过两种互补的技术应对这两个挑战:首先,我们开发了一种梯度提升风格的非参数函数逼近器,用于在函数残差上学习。其次,我们提出了一种受不确定性下状态抽象和信息获取原则启发的探索策略。我们首先在两个标准任务(Blackjack和-Chain)上证明了这些技术的经验有效性,作为初步检查,然后在两个具有更高维观测空间的更大、更真实的任务上进行了证明。具体而言,我们引入了在游戏Minecraft内构建的两个基准测试,其中观测是智能体视野的像素数组。我们的两种算法技术相结合,在标准强化学习任务上表现具有竞争力,同时在两个高维观测空间任务上持续且大幅优于基线。新的函数逼近器、探索策略和评估基准在追求可扩展到真实世界领域的强化学习方法方面各自具有独立的兴趣。
引用
@article{arxiv.1603.04119,
title = {Exploratory Gradient Boosting for Reinforcement Learning in Complex Domains},
author = {David Abel and Alekh Agarwal and Fernando Diaz and Akshay Krishnamurthy and Robert E. Schapire},
journal= {arXiv preprint arXiv:1603.04119},
year = {2016}
}