中文

TransDreamer:基于 Transformer 世界模型的强化学习

机器学习 2024-11-20 v2

摘要

Dreamer 智能体提供了基于模型的强化学习(MBRL)的多种益处,如样本效率、可复用知识和安全规划。然而,其世界模型与策略网络继承了循环神经网络的局限性,因此一个重要问题在于 MBRL 框架如何能从 transformer 的近期进展中受益以及这样做面临哪些挑战。本文提出一种基于 transformer 的 MBRL 智能体,称为 TransDreamer。我们首先引入 Transformer 状态空间模型,一种利用 transformer 进行动态预测的世界模型。然后将该世界模型与基于 transformer 的策略网络共享,从而在训练基于 transformer 的 RL 智能体时获得稳定性。在实验中,我们将所提模型应用于 2D 视觉 RL 和 3D 第一人称视觉 RL 任务,二者均需要用于基于记忆推理的长程记忆访问。我们表明所提模型在这些复杂任务上优于 Dreamer。

关键词

引用

@article{arxiv.2202.09481,
  title  = {TransDreamer: Reinforcement Learning with Transformer World Models},
  author = {Chang Chen and Yi-Fu Wu and Jaesik Yoon and Sungjin Ahn},
  journal= {arXiv preprint arXiv:2202.09481},
  year   = {2024}
}

备注

Deep RL Workshop NeurIPS 2021