循环元强化学习智能体内部发生了什么?
机器学习
2021-05-03 v1 人工智能
摘要
循环元强化学习(meta-RL)智能体是指采用循环神经网络(RNN)以用于“学习一种学习算法”目的的智能体。在预先指定的任务分布上训练后,该智能体 RNN 的学习到的权重据称通过其活动动态实现了一种高效学习算法,这使得智能体能够快速解决从同一分布中采样的新任务。然而,由于这些智能体的黑盒性质,它们的工作方式尚未被完全理解。在本研究中,我们通过使用部分可观测马尔可夫决策过程(POMDP)框架重新表述元强化学习问题,阐明了这些智能体的内部工作机制。我们假设学习到的活动动态充当此类智能体的信念状态。若干说明性实验表明该假设成立,且循环元强化学习智能体可被视为在由多个相关任务构成的部分可观测环境中学习最优行动的智能体。这一视角有助于理解它们的失败案例以及文献中报道的一些有趣的基于模型的结果。
引用
@article{arxiv.2104.14644,
title = {What is Going on Inside Recurrent Meta Reinforcement Learning Agents?},
author = {Safa Alver and Doina Precup},
journal= {arXiv preprint arXiv:2104.14644},
year = {2021}
}
备注
Accepted to the Never-Ending Reinforcement Learning Workshop at ICLR 2021