中文

Decision Transformer:通过序列建模进行强化学习

机器学习 2021-06-25 v2 人工智能

摘要

我们引入了一个将强化学习(RL)抽象为序列建模问题的框架。这使我们能够利用 Transformer 架构的简洁性与可扩展性,以及语言建模的相关进展,如 GPT-x 和 BERT。具体而言,我们提出 Decision Transformer,一种将 RL 问题转化为条件序列建模的架构。与先前拟合价值函数或计算策略梯度的 RL 方法不同,Decision Transformer 简单地通过利用因果掩码 Transformer 输出最优动作。通过对自回归模型以期望回报(奖励)、过去状态和动作为条件,我们的 Decision Transformer 模型能够生成实现期望回报的未来动作。尽管简单,Decision Transformer 在 Atari、OpenAI Gym 和 Key-to-Door 任务上匹配或超越了最先进的免模型离线 RL 基线。

关键词

引用

@article{arxiv.2106.01345,
  title  = {Decision Transformer: Reinforcement Learning via Sequence Modeling},
  author = {Lili Chen and Kevin Lu and Aravind Rajeswaran and Kimin Lee and Aditya Grover and Michael Laskin and Pieter Abbeel and Aravind Srinivas and Igor Mordatch},
  journal= {arXiv preprint arXiv:2106.01345},
  year   = {2021}
}

备注

First two authors contributed equally. Last two authors advised equally