RePreM:用于强化学习的基于掩码模型的表示预训练
机器学习
2023-03-06 v1 人工智能
摘要
受近期序列建模在 RL 中成功以及掩码语言模型用于预训练的启发,我们提出一种用于 RL 预训练的掩码模型 RePreM(Representation Pre-training with Masked Model),其训练结合 transformer 模块的编码器以预测轨迹中被掩码的状态或动作。与现有 RL 表示预训练方法相比,RePreM 简单而有效。它通过序列建模避免了算法上的繁复(如数据增强或估计多个模型),并生成能良好捕捉长期动态的表示。在经验上,我们在包括动态预测、迁移学习以及基于值与 actor-critic 方法的样本高效 RL 等多种任务中展示了 RePreM 的有效性。此外,我们表明 RePreM 随数据集规模、数据集质量与编码器规模均良好扩展,这指示了其面向大型 RL 模型的潜力。
引用
@article{arxiv.2303.01668,
title = {RePreM: Representation Pre-training with Masked Model for Reinforcement Learning},
author = {Yuanying Cai and Chuheng Zhang and Wei Shen and Xuyun Zhang and Wenjie Ruan and Longbo Huang},
journal= {arXiv preprint arXiv:2303.01668},
year = {2023}
}
备注
Accepted by AAAI-23