中文

MOORe:基于模型的离线到在线强化学习

机器学习 2022-01-26 v1

摘要

随着离线强化学习(RL)的成功,离线训练的RL策略在部署到在线环境时具有进一步改进的潜力。策略的平滑过渡在实际部署的安全性中至关重要。此外,策略的快速适应在实际在线性能提升中起着关键作用。为了解决这些挑战,我们提出了一种简单而高效的算法,即基于模型的离线到在线强化学习(MOORe),该算法采用了一种优先采样方案,可以动态调整离线和在线数据,以实现策略的平滑和高效的在线适应。我们为算法设计提供了理论基础。在D4RL基准测试上的实验结果表明,我们的算法能够平滑地从离线阶段过渡到在线阶段,同时实现样本高效的在线适应,并且显著优于现有方法。

关键词

引用

@article{arxiv.2201.10070,
  title  = {MOORe: Model-based Offline-to-Online Reinforcement Learning},
  author = {Yihuan Mao and Chao Wang and Bin Wang and Chongjie Zhang},
  journal= {arXiv preprint arXiv:2201.10070},
  year   = {2022}
}