以无动作离线预训练引导在线强化学习
机器学习
2023-03-23 v2 人工智能
摘要
离线 RL 方法已被证明可通过使用离线收集的回合训练智能体来减少对环境交互的需求。然而,这些方法通常要求在数据收集期间记录动作信息,这在某些实际情况下可能困难甚至不可能。在本文中,我们研究利用无动作离线数据集改进在线强化学习的潜力,将这一问题命名为无动作离线预训练强化学习(AFP-RL)。我们提出 Action-Free Guide(AF-Guide),一种通过从无动作离线数据集中提取知识来引导在线训练的方法。AF-Guide 由一个实现倒置强化学习变体的 Action-Free Decision Transformer(AFDT)和一个受 AFDT 引导进行在线学习的 Guided Soft Actor-Critic(Guided SAC)组成。AFDT 从离线数据集中学习规划下一状态,Guided SAC 借助 AFDT 的引导进行在线学习。实验结果表明,得益于无动作离线数据集中的知识,AF-Guide 能够提升在线训练的样本效率与性能。代码见 https://github.com/Vision-CAIR/AF-Guide。
引用
@article{arxiv.2301.12876,
title = {Guiding Online Reinforcement Learning with Action-Free Offline Pretraining},
author = {Deyao Zhu and Yuhui Wang and Jürgen Schmidhuber and Mohamed Elhoseiny},
journal= {arXiv preprint arXiv:2301.12876},
year = {2023}
}