稳定基于 Transformer 的 Q-Learning 动作序列生成
机器学习
2020-12-21 v2
摘要
自原始 Transformer 架构(Vaswani 等人 2017)发表以来,Transformer 彻底改变了自然语言处理领域。这主要归功于其比基于 RNN 的竞争架构更能理解时序依赖关系。令人惊讶的是,尽管 RNN 在强化学习(RL)中相当流行且时序依赖在 RL 中非常常见,这一架构变革却未影响 RL 领域。最近,Parisotto 等人(2019)开展了 Transformer 在 RL 中的首个有前景的研究。为支持该工作的发现,本文力求提供一个基于 Transformer 的 RL 方法的额外示例。具体而言,目标是构建一个简单的、在多个环境中稳定的基于 Transformer 的深度 Q-Learning 方法。由于 Transformer 与 RL 本身的不稳定性,我们进行了广泛的方法搜索,最终得到一种结合 Transformer 与 Q-learning 相关进展的方法。所提方法在控制环境中可匹配经典 Q-learning 的性能,同时在部分选定的 Atari 基准上展现出潜力。此外,我们对其进行了批判性评估,以深入揭示 Transformer 与 RL 之间的关系。
引用
@article{arxiv.2010.12698,
title = {Stabilizing Transformer-Based Action Sequence Generation For Q-Learning},
author = {Gideon Stein and Andrey Filchenkov and Arip Asadulaev},
journal= {arXiv preprint arXiv:2010.12698},
year = {2020}
}
备注
Transformers, Reinforcement Learning, 8 pages, AAAI format