基于并行算法竞争的在线元学习
机器学习
2017-02-27 v1
摘要
强化学习算法的效率在很大程度上取决于少数几个元参数,这些参数调节学习更新以及探索与利用之间的权衡。元参数的适配是强化学习中的一个开放问题,随着深度强化学习在高维状态空间中取得成功,这 arguably 近期已成为更大的问题。在 Atari 2600 电子游戏等领域中,漫长的学习时间使得对合适的元参数值进行全面搜索变得不可行。我们提出了基于并行算法竞争的在线元学习(Online Meta-learning by Parallel Algorithm Competition, OMPAC)方法。在 OMPAC 方法中,一个强化学习算法的多个实例并行运行,其元参数的初始值存在微小差异。在固定轮次之后,根据实例在当前任务中的表现对其进行选择。在继续学习之前,以预定义概率向元参数中添加高斯噪声。我们通过在随机 SZ-Tetris 与使用更小 棋盘的标准 Tetris 中分别将当前最优结果提升 31% 与 84%,以及在三款 Atari 2600 游戏中将深度 Sarsa() 智能体的结果提升 62% 或更多,验证了 OMPAC 方法的有效性。实验还表明,OMPAC 方法能够根据不同任务中的学习进度适配元参数。
引用
@article{arxiv.1702.07490,
title = {Online Meta-learning by Parallel Algorithm Competition},
author = {Stefan Elfwing and Eiji Uchibe and Kenji Doya},
journal= {arXiv preprint arXiv:1702.07490},
year = {2017}
}
备注
15 pages, 10 figures. arXiv admin note: text overlap with arXiv:1702.03118