在动态 POMDP 问题中演化先天知识以实现快速适应
神经与进化计算
2020-04-29 v2 人工智能
机器学习
摘要
对变化任务的快速在线适应是机器学习中的重要问题,且近来成为元强化学习的焦点。然而,强化学习(RL)算法在 POMDP 环境中表现不佳,因为 RL 框架所必需的系统状态并非总是可见。此外,手工设计的元 RL 架构可能未包含适用于特定学习问题的计算结构。相反,在线学习机制的演化能够将学习策略整合进智能体,从而(i)在需要时演化记忆,以及(ii)优化对特定在线学习问题的适应速度。本文中,我们利用神经调制神经网络的高度适应性,演化出一个在 POMDP 中使用自编码器潜空间的控制器。对演化网络的分析揭示了所提算法在多方面获取先天知识的能力,例如检测隐含奖励的线索,以及演化有助于导航的位置神经元。先天知识与在线可塑性的结合实现了快速适应,并相较于一些非演化元强化学习算法获得更优性能。该算法还被证明能在 3D 游戏环境 Malmo Minecraft 中取得成功。
引用
@article{arxiv.2004.12846,
title = {Evolving Inborn Knowledge For Fast Adaptation in Dynamic POMDP Problems},
author = {Eseoghene Ben-Iwhiwhu and Pawel Ladosz and Jeffery Dick and Wen-Hua Chen and Praveen Pilly and Andrea Soltoggio},
journal= {arXiv preprint arXiv:2004.12846},
year = {2020}
}
备注
9 pages. Accepted as a full paper in the Genetic and Evolutionary Computation Conference (GECCO 2020)