维基百科能否助力离线强化学习?
机器学习
2022-07-26 v3 人工智能
计算与语言
摘要
由于缺乏大规模现成数据集以及不同环境间可迁移性方差大,强化学习(RL)模型的微调一直具有挑战性。近期工作从序列建模的角度处理离线RL,并因引入Transformer架构而取得了改进结果。然而,当模型从头训练时,其收敛速度较慢。在本文中,我们着眼于利用这种将强化学习视为序列建模的 formulation,并研究在其他领域(视觉、语言)上预训练的序列模型在微调到离线RL任务(控制、游戏)时的可迁移性。为此,我们还提出了改善这些领域间迁移的技术。结果表明,在使用维基百科预训练模型和GPT2语言模型的各种环境中,收敛速度和奖励均有一致的性能提升,训练加速3-6倍,并在多种任务上达到最先进(SOTA)性能。我们希望这项工作不仅能揭示利用通用序列建模技术与预训练模型用于RL的潜力,也能启发未来关于完全不同领域的生成建模任务间知识共享的研究。
引用
@article{arxiv.2201.12122,
title = {Can Wikipedia Help Offline Reinforcement Learning?},
author = {Machel Reid and Yutaro Yamada and Shixiang Shane Gu},
journal= {arXiv preprint arXiv:2201.12122},
year = {2022}
}