增强型 POET:通过无界发明学习挑战及其解实现开放式强化学习
神经与进化计算
2020-04-14 v2
摘要
创建开放式算法,即生成自身永无止境的新颖且适当困难的学习机会流,有助于自动化并加速机器学习中的进展。最近朝此方向迈出的一步是配对开放式开拓者(POET),一种生成并求解自身挑战的算法,并允许智能体在挑战间进行目标切换以避免局部最优。然而,原始 POET 由于算法本身的局限以及外部问题(包括有限的问题空间和缺乏通用进展度量)而未能展现其全部创造潜力。重要的是,这两类局限不仅对 POET 构成阻碍,也对开放式性研究总体构成阻碍。本文引入并实证验证了对原始算法的两项新创新,以及两项旨在帮助阐明其全部潜力的外部创新。 together,这四项进展实现了迄今为止最开放的算法演示。算法创新为:(1)衡量新挑战具有何种有意义新颖性的领域通用度量,使系统能潜在地无尽创建并求解有趣挑战;(2)判断智能体何时应从一问题目标切换到另一问题的有效启发式(帮助开放式搜索更好地扩展)。在算法之外,为达成更明确的开放式性演示,我们引入(3)一种新颖、更灵活的环境挑战编码方式,以及(4)衡量系统持续展现开放式创新程度的通用度量。增强型 POET 产生了多样 sophisticated 行为,求解广泛的环境挑战,其中许多无法通过其他手段求解。
引用
@article{arxiv.2003.08536,
title = {Enhanced POET: Open-Ended Reinforcement Learning through Unbounded Invention of Learning Challenges and their Solutions},
author = {Rui Wang and Joel Lehman and Aditya Rawal and Jiale Zhi and Yulun Li and Jeff Clune and Kenneth O. Stanley},
journal= {arXiv preprint arXiv:2003.08536},
year = {2020}
}
备注
23 pages, 14 figures