中文

加速在线强化学习中的Transformer

机器学习 2025-10-01 v1

摘要

基于Transformer的模型在强化学习(RL)中的出现扩展了机器人任务的可能性,但同时在其实现过程中带来了一系列挑战,尤其是在无模型在线RL中。由于Transformer的不稳定性,一些现有的学习算法难以与其轻松实现。在本文中,我们提出了一种使用加速器策略作为Transformer训练器的方法。加速器是一个更简单、更稳定的模型,它独立与环境交互,同时在所提算法的第一阶段通过行为克隆训练Transformer。在第二阶段,预训练的Transformer开始在完全在线的环境中与环境交互。结果,这种无模型算法在性能上加速了Transformer,并帮助其以更稳定、更快的方式进行在线训练。通过在基于状态和基于图像的ManiSkill环境以及MDP和POMDP设置下的MuJoCo任务上进行实验,我们表明应用我们的算法不仅能够实现Transformer的稳定训练,还能将基于图像的环境的训练时间减少多达两倍。此外,它将离线策略方法中所需的重放缓冲区大小降低到1万到2万,从而显著降低了整体计算需求。

关键词

引用

@article{arxiv.2509.26137,
  title  = {Accelerating Transformers in Online RL},
  author = {Daniil Zelezetsky and Alexey K. Kovalev and Aleksandr I. Panov},
  journal= {arXiv preprint arXiv:2509.26137},
  year   = {2025}
}