提高数据效率强化学习中 Transformer 世界模型的性能
机器学习
2025-07-18 v3 人工智能
摘要
我们提出了三项改进,基于Transformer的标准模型强化学习范式:(a)“带热身的Dyna”,在真实和虚构数据上训练政策,但仅在世界模型充分训练后才开始使用虚构数据;(b)基于图像块的最近邻标记化器,改进了之前需要的标记化方案(用于Transformer世界模型TWM),确保词码表在创建后保持静态,从而为TWM学习提供恒定目标;(c)“块教师强制”,允许TWM就未来时间步的多个标记联合推理,而非逐个生成。随后我们证明,在各种环境中,我们的方法在先前方法之上显著改进。我们主要关注具有挑战性的Craftax-Classic基准,该方法在仅用100万个环境步骤后即可实现69.66%的奖励,显著优于DreamerV3的53.2%,并首次超越人类水平的65.0%。我们还在Craftax-full、MinAtar和三个不同的双人游戏中展示了初步结果,以说明该方法的通用性。
引用
@article{arxiv.2502.01591,
title = {Improving Transformer World Models for Data-Efficient RL},
author = {Antoine Dedieu and Joseph Ortiz and Xinghua Lou and Carter Wendelken and Wolfgang Lehrach and J Swaroop Guntupalli and Miguel Lazaro-Gredilla and Kevin Patrick Murphy},
journal= {arXiv preprint arXiv:2502.01591},
year = {2025}
}
备注
ICML 2025