离线到在线强化学习的非整体式策略方法
机器学习
2024-11-01 v1
摘要
离线到在线强化学习(RL)同时利用预训练的离线策略和针对下游任务训练的在线策略,旨在提高数据效率并加速性能提升。现有方法策略扩展(PEX)利用由两种策略组成的策略集,在不修改离线策略的情况下进行探索与学习。然而,该方法由于过度关注两种策略的探索,未能确保在线策略的充分学习。由于预训练的离线策略可以基于其先前经验协助在线策略在下游任务中进行利用,因此应有效执行并针对下游任务的具体需求进行定制。相比之下,在线策略具有不成熟的行为策略,在训练阶段具有探索的潜力。因此,本研究聚焦于在不修改离线策略的前提下协调离线策略的优势(即利用)与在线策略的优势(即探索)。在本研究中,我们提出了一种创新的离线到在线RL方法,采用非整体式探索方法。我们的方法在性能上优于PEX。
引用
@article{arxiv.2410.23737,
title = {A Non-Monolithic Policy Approach of Offline-to-Online Reinforcement Learning},
author = {JaeYoon Kim and Junyu Xuan and Christy Liang and Farookh Hussain},
journal= {arXiv preprint arXiv:2410.23737},
year = {2024}
}
备注
ICONIP 2024