中文

在动态 POMDP 问题中演化先天知识以实现快速适应

神经与进化计算 2020-04-29 v2 人工智能 机器学习

摘要

对变化任务的快速在线适应是机器学习中的重要问题,且近来成为元强化学习的焦点。然而,强化学习(RL)算法在 POMDP 环境中表现不佳,因为 RL 框架所必需的系统状态并非总是可见。此外,手工设计的元 RL 架构可能未包含适用于特定学习问题的计算结构。相反,在线学习机制的演化能够将学习策略整合进智能体,从而(i)在需要时演化记忆,以及(ii)优化对特定在线学习问题的适应速度。本文中,我们利用神经调制神经网络的高度适应性,演化出一个在 POMDP 中使用自编码器潜空间的控制器。对演化网络的分析揭示了所提算法在多方面获取先天知识的能力,例如检测隐含奖励的线索,以及演化有助于导航的位置神经元。先天知识与在线可塑性的结合实现了快速适应,并相较于一些非演化元强化学习算法获得更优性能。该算法还被证明能在 3D 游戏环境 Malmo Minecraft 中取得成功。

关键词

引用

@article{arxiv.2004.12846,
  title  = {Evolving Inborn Knowledge For Fast Adaptation in Dynamic POMDP Problems},
  author = {Eseoghene Ben-Iwhiwhu and Pawel Ladosz and Jeffery Dick and Wen-Hua Chen and Praveen Pilly and Andrea Soltoggio},
  journal= {arXiv preprint arXiv:2004.12846},
  year   = {2020}
}

备注

9 pages. Accepted as a full paper in the Genetic and Evolutionary Computation Conference (GECCO 2020)