稳定化Transformer用于强化学习
机器学习
2019-10-16 v1 人工智能
机器学习
摘要
由于其能够有效整合长时程信息并扩展到海量数据,自注意力架构最近在自然语言处理(NLP)中取得了突破性成功,在语言建模和机器翻译等领域达到了最先进的结果。利用Transformer处理长时程信息的能力,可能在部分可观测强化学习(RL)领域中提供类似的性能提升,但NLP中使用的大规模Transformer尚未成功应用于RL设定。在这项工作中,我们证明了标准Transformer架构难以优化,这先前在监督学习设定中已被观察到,但在RL目标下尤为明显。我们提出了架构修改,大幅提升了原始Transformer和XL变体的稳定性和学习速度。所提出的架构,即门控Transformer-XL(GTrXL),在具有挑战性的记忆环境中超越了LSTM,并在多任务DMLab-30基准套件上取得了最先进的结果,超过了外部记忆架构的性能。我们表明,使用相同损失训练的GTrXL的稳定性和性能始终匹配或超过有竞争力的LSTM基线,包括在记忆较不关键、更具反应性的任务上。GTrXL为部分可观测环境中RL智能体普遍使用的标准多层LSTM提供了一种易于训练、实现简单但表达力显著更强的架构替代方案。
引用
@article{arxiv.1910.06764,
title = {Stabilizing Transformers for Reinforcement Learning},
author = {Emilio Parisotto and H. Francis Song and Jack W. Rae and Razvan Pascanu and Caglar Gulcehre and Siddhant M. Jayakumar and Max Jaderberg and Raphael Lopez Kaufman and Aidan Clark and Seb Noury and Matthew M. Botvinick and Nicolas Heess and Raia Hadsell},
journal= {arXiv preprint arXiv:1910.06764},
year = {2019}
}