中文

以 Transformer in Transformer 作为深度强化学习的骨干网络

机器学习 2023-01-04 v2 人工智能 机器人学

摘要

设计更好的深度网络与更好的强化学习(RL)算法对深度 RL 均十分重要。本工作关注前者。已有方法通过 CNN、LSTM 和 Attention 等若干模块构建网络。近期方法将这些模块与 Transformer 结合以提升性能。然而,训练由混合模块组成的网络需要繁琐的优化技巧,使得这些方法在实践中不便使用。本文提出设计基于纯 Transformer 的网络用于深度 RL,旨在为在线与离线设定均提供即用型骨干。具体而言,我们提出了 Transformer in Transformer(TIT)骨干,其以非常自然的方式级联两个 Transformer:内层用于处理单个观测,外层负责处理观测历史;二者结合有望提取时空表征以辅助良好决策。实验表明,TIT 在不同设定下均能取得令人满意的一致性能。

关键词

引用

@article{arxiv.2212.14538,
  title  = {Transformer in Transformer as Backbone for Deep Reinforcement Learning},
  author = {Hangyu Mao and Rui Zhao and Hao Chen and Jianye Hao and Yiqun Chen and Dong Li and Junge Zhang and Zhen Xiao},
  journal= {arXiv preprint arXiv:2212.14538},
  year   = {2023}
}

备注

As far as we know, TIT is the first pure Transformer-based backbone for deep online and offline RL, and it also extends the offline SL paradigm proposed by Decision Transformer