用于强化学习泛化的特征注意力循环模块
机器学习
2023-11-06 v3 人工智能
摘要
许多重要任务都是围绕物体定义的。为了在这些任务上实现泛化,强化学习(RL)智能体需要利用物体所诱导的结构。先前的工作要么硬编码以物体为中心的特征,要么使用复杂的以物体为中心的生成模型,要么使用局部空间特征更新状态。然而,这些方法在赋能通用 RL 智能体方面成效有限。受此驱动,我们提出了“特征注意力循环模块”(FARM),一种用于学习状态表示的架构,它依赖于简单、广泛适用的归纳偏置来捕捉空间和时间规律性。FARM 学习一种分布在多个模块上的状态表示,每个模块通过具表达力的特征注意力机制关注时空特征。我们表明这提升了 RL 智能体在以物体为中心任务上的泛化能力。我们在 2D 和 3D 环境中研究了任务套件,发现与采用注意力或多模块的竞争架构相比,FARM 具有更好的泛化能力。
引用
@article{arxiv.2112.08369,
title = {Feature-Attending Recurrent Modules for Generalization in Reinforcement Learning},
author = {Wilka Carvalho and Andrew Lampinen and Kyriacos Nikiforou and Felix Hill and Murray Shanahan},
journal= {arXiv preprint arXiv:2112.08369},
year = {2023}
}
备注
TMLR, 2023