以 Transformer in Transformer 作为深度强化学习的骨干网络
机器学习
2023-01-04 v2 人工智能
机器人学
摘要
设计更好的深度网络与更好的强化学习(RL)算法对深度 RL 均十分重要。本工作关注前者。已有方法通过 CNN、LSTM 和 Attention 等若干模块构建网络。近期方法将这些模块与 Transformer 结合以提升性能。然而,训练由混合模块组成的网络需要繁琐的优化技巧,使得这些方法在实践中不便使用。本文提出设计基于纯 Transformer 的网络用于深度 RL,旨在为在线与离线设定均提供即用型骨干。具体而言,我们提出了 Transformer in Transformer(TIT)骨干,其以非常自然的方式级联两个 Transformer:内层用于处理单个观测,外层负责处理观测历史;二者结合有望提取时空表征以辅助良好决策。实验表明,TIT 在不同设定下均能取得令人满意的一致性能。
引用
@article{arxiv.2212.14538,
title = {Transformer in Transformer as Backbone for Deep Reinforcement Learning},
author = {Hangyu Mao and Rui Zhao and Hao Chen and Jianye Hao and Yiqun Chen and Dong Li and Junge Zhang and Zhen Xiao},
journal= {arXiv preprint arXiv:2212.14538},
year = {2023}
}
备注
As far as we know, TIT is the first pure Transformer-based backbone for deep online and offline RL, and it also extends the offline SL paradigm proposed by Decision Transformer