循环独立机制的快学习与慢学习
机器学习
2021-05-20 v2 人工智能
摘要
将知识分解为可互换的片段,在分布发生变化时有望带来泛化优势。与所处环境交互的学习智能体很可能面临需要现有知识片段进行新颖组合的情形。我们假设,这种知识分解对于能够系统性地泛化到分布外变化尤为关键。为研究这些想法,我们提出了一种特定的训练框架,其中假设智能体所需的知识片段及其奖励函数是平稳的,并且可以跨任务复用。一种注意力机制动态选择哪些模块可适应当前任务,所选模块的参数在智能体遭遇其所经历事物的变化时允许快速改变,而注意力机制的参数则充当稳定、缓慢变化的元参数。我们聚焦于由一组模块通过注意力瓶颈进行稀疏相互通信所捕获的知识片段。我们发现,对 proposed 系统的模块化方面进行元学习,极大有助于在涉及部分可观测网格世界中基于图像级输入的导航的强化学习设置中实现更快的适应。我们还发现,反转参数与元参数的角色效果差得多,这表明动态所选模块的快速适应具有特殊作用。
引用
@article{arxiv.2105.08710,
title = {Fast and Slow Learning of Recurrent Independent Mechanisms},
author = {Kanika Madan and Nan Rosemary Ke and Anirudh Goyal and Bernhard Schölkopf and Yoshua Bengio},
journal= {arXiv preprint arXiv:2105.08710},
year = {2021}
}
备注
Accepted at ICLR'21