从无监督到在线强化学习
机器学习
2024-08-28 v1
摘要
离线到在线强化学习(RL)框架先用离线RL训练策略,再用在线RL进一步微调,一直被认为是数据驱动决策的一种有前景的方案。虽然合理,但该框架存在缺点:它需要为每个任务进行特定领域的监督式离线RL预训练,且在实践中往往很脆弱。在这项工作中,我们提出从无监督到在线RL(U2O RL),用无监督离线RL替代特定领域的监督式离线RL,作为离线到在线RL的更优替代方案。U2O RL不仅能够为多个下游任务重用单个预训练模型,还能学习到更好的表征,这通常能带来比监督式离线到在线RL更好的性能和稳定性。为了在实践中实例化U2O RL,我们提出了一个通用的U2O RL方案,以桥接任务无关的无监督离线基于技能的预训练和监督式在线微调。通过在九个基于状态和基于像素的环境中的实验,我们实证证明U2O RL实现了强大的性能,匹配甚至超越了以往的离线到在线RL方法,同时能够为多个不同的下游任务重用单个预训练模型。
引用
@article{arxiv.2408.14785,
title = {Unsupervised-to-Online Reinforcement Learning},
author = {Junsu Kim and Seohong Park and Sergey Levine},
journal= {arXiv preprint arXiv:2408.14785},
year = {2024}
}