中文

稳定基于 Transformer 的 Q-Learning 动作序列生成

机器学习 2020-12-21 v2

摘要

自原始 Transformer 架构(Vaswani 等人 2017)发表以来,Transformer 彻底改变了自然语言处理领域。这主要归功于其比基于 RNN 的竞争架构更能理解时序依赖关系。令人惊讶的是,尽管 RNN 在强化学习(RL)中相当流行且时序依赖在 RL 中非常常见,这一架构变革却未影响 RL 领域。最近,Parisotto 等人(2019)开展了 Transformer 在 RL 中的首个有前景的研究。为支持该工作的发现,本文力求提供一个基于 Transformer 的 RL 方法的额外示例。具体而言,目标是构建一个简单的、在多个环境中稳定的基于 Transformer 的深度 Q-Learning 方法。由于 Transformer 与 RL 本身的不稳定性,我们进行了广泛的方法搜索,最终得到一种结合 Transformer 与 Q-learning 相关进展的方法。所提方法在控制环境中可匹配经典 Q-learning 的性能,同时在部分选定的 Atari 基准上展现出潜力。此外,我们对其进行了批判性评估,以深入揭示 Transformer 与 RL 之间的关系。

关键词

引用

@article{arxiv.2010.12698,
  title  = {Stabilizing Transformer-Based Action Sequence Generation For Q-Learning},
  author = {Gideon Stein and Andrey Filchenkov and Arip Asadulaev},
  journal= {arXiv preprint arXiv:2010.12698},
  year   = {2020}
}

备注

Transformers, Reinforcement Learning, 8 pages, AAAI format