TransDreamer:基于 Transformer 世界模型的强化学习
机器学习
2024-11-20 v2
摘要
Dreamer 智能体提供了基于模型的强化学习(MBRL)的多种益处,如样本效率、可复用知识和安全规划。然而,其世界模型与策略网络继承了循环神经网络的局限性,因此一个重要问题在于 MBRL 框架如何能从 transformer 的近期进展中受益以及这样做面临哪些挑战。本文提出一种基于 transformer 的 MBRL 智能体,称为 TransDreamer。我们首先引入 Transformer 状态空间模型,一种利用 transformer 进行动态预测的世界模型。然后将该世界模型与基于 transformer 的策略网络共享,从而在训练基于 transformer 的 RL 智能体时获得稳定性。在实验中,我们将所提模型应用于 2D 视觉 RL 和 3D 第一人称视觉 RL 任务,二者均需要用于基于记忆推理的长程记忆访问。我们表明所提模型在这些复杂任务上优于 Dreamer。
引用
@article{arxiv.2202.09481,
title = {TransDreamer: Reinforcement Learning with Transformer World Models},
author = {Chang Chen and Yi-Fu Wu and Jaesik Yoon and Sungjin Ahn},
journal= {arXiv preprint arXiv:2202.09481},
year = {2024}
}
备注
Deep RL Workshop NeurIPS 2021