中文

RePreM:用于强化学习的基于掩码模型的表示预训练

机器学习 2023-03-06 v1 人工智能

摘要

受近期序列建模在 RL 中成功以及掩码语言模型用于预训练的启发,我们提出一种用于 RL 预训练的掩码模型 RePreM(Representation Pre-training with Masked Model),其训练结合 transformer 模块的编码器以预测轨迹中被掩码的状态或动作。与现有 RL 表示预训练方法相比,RePreM 简单而有效。它通过序列建模避免了算法上的繁复(如数据增强或估计多个模型),并生成能良好捕捉长期动态的表示。在经验上,我们在包括动态预测、迁移学习以及基于值与 actor-critic 方法的样本高效 RL 等多种任务中展示了 RePreM 的有效性。此外,我们表明 RePreM 随数据集规模、数据集质量与编码器规模均良好扩展,这指示了其面向大型 RL 模型的潜力。

关键词

引用

@article{arxiv.2303.01668,
  title  = {RePreM: Representation Pre-training with Masked Model for Reinforcement Learning},
  author = {Yuanying Cai and Chuheng Zhang and Wei Shen and Xuyun Zhang and Wenjie Ruan and Longbo Huang},
  journal= {arXiv preprint arXiv:2303.01668},
  year   = {2023}
}

备注

Accepted by AAAI-23