中文

图决策 Transformer

机器学习 2023-03-08 v1 人工智能

摘要

离线强化学习(RL)是一项具有挑战性的任务,其目标是从静态轨迹数据中学习策略而无需与环境交互。近来,离线RL被视为序列建模问题,其中智能体基于一组静态转移经验生成后续动作序列。然而,现有使用 transformer 朴素地关注所有 token 的方法可能忽略不同 token 间的依赖关系,并限制长期依赖学习。本文中,我们提出图决策 Transformer(GDT),一种新颖的离线RL方法,将输入序列建模为因果图以捕获根本不同概念间的潜在依赖,并促进时间与因果关系学习。GDT使用图 transformer 以关系增强机制处理图输入,并可选地使用序列 transformer 处理视觉任务中的细粒度空间信息。我们的实验表明,在基于图像的 Atari 与 OpenAI Gym 上,GDT匹配或超越了最先进离线RL方法的性能。

关键词

引用

@article{arxiv.2303.03747,
  title  = {Graph Decision Transformer},
  author = {Shengchao Hu and Li Shen and Ya Zhang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2303.03747},
  year   = {2023}
}

备注

14 pages