Transformer是元强化学习器
机器学习
2022-06-15 v1 人工智能
摘要
Transformer架构及其变体近年来在许多机器学习任务中取得了显著成功。这一成功本质上与处理长序列的能力以及注意力机制中上下文相关权重的存在有关。我们认为这些能力契合元强化学习(meta-RL)算法的核心角色。事实上,元-RL智能体需要从一段轨迹序列中推断任务。此外,它需要一种快速适应策略来为新任务调整其策略——这可利用自注意力机制实现。在这项工作中,我们提出TrMRL(用于元强化学习的Transformer),一种利用Transformer架构模拟记忆重现机制的元-RL智能体。它通过Transformer层将近期工作记忆关联起来,递归地构建情景记忆。我们表明,自注意力计算了在每个层上最小化贝叶斯风险的共识表示,并为计算最优动作提供了有意义的特征。我们在用于运动和灵巧操作的高维连续控制环境中进行了实验。结果表明,在这些环境中,与基线相比,TrMRL具有相当或更优的渐近性能、样本效率和分布外泛化能力。
引用
@article{arxiv.2206.06614,
title = {Transformers are Meta-Reinforcement Learners},
author = {Luckeciano C. Melo},
journal= {arXiv preprint arXiv:2206.06614},
year = {2022}
}
备注
Published at the International Conference on Machine Learning (ICML) 2022