桥接离线到在线强化学习的策略扩展
人工智能
2025-09-01 v4
摘要
利用离线数据预训练并使用强化学习进行在线微调,是一种通过结合样本效率与性能两方面优势来学习控制策略的有前景策略。一种自然的方法是用离线训练的策初始化在线学习的策略。本工作中,我们为该任务引入一种策略扩展方案。在学习离线策略后,我们将其作为策略集中的一个候选策略。随后我们用另一个负责进一步学习的策略扩展该策略集。两个策略将以自适应方式组合以与环境交互。通过此方法,先前离线学习的策略在在线学习期间被完全保留,从而缓解诸如在线学习初始阶段破坏离线策略有用行为的问题,同时允许离线策略以自适应方式自然参与探索。此外,新添加的策略可通过学习潜在捕获新的有用行为。我们在若干任务上进行了实验,结果证明了所提方法的有效性。代码见 https://github.com/Haichao-Zhang/PEX
引用
@article{arxiv.2302.00935,
title = {Policy Expansion for Bridging Offline-to-Online Reinforcement Learning},
author = {Haichao Zhang and We Xu and Haonan Yu},
journal= {arXiv preprint arXiv:2302.00935},
year = {2025}
}
备注
ICLR 2023