混合传递强化学习:从移位动力学数据实现可证明的样本效率
机器学习
2024-11-07 v1 机器学习
摘要
在线强化学习(RL)通常需要高风险的在线交互数据来学习针对目标任务的策略。这促使人们关注如何利用历史数据来提高样本效率。历史数据可能来自过时或相关的源环境,且具有不同的动力学。如何在目标任务中有效地利用此类数据以在可证明的方式下提高学习与样本效率,仍然是未知的。为此,我们提出了一种混合传递强化学习(HTRL)设置,即在目标环境中学习,同时访问来自动力学移位的源环境的离线数据。我们表明,在缺乏动力学移位信息的情况下,一般的移位动力学数据,即使是细微的移位,也不会降低目标环境中的样本复杂度。然而,若获得动力学移位程度的先验信息,我们设计了HySRL,该算法实现问题相关的样本复杂度,并优于纯在线强化学习。最后,我们的实验结果表明,HySRL超越了最先进的在线RL基线方法。
引用
@article{arxiv.2411.03810,
title = {Hybrid Transfer Reinforcement Learning: Provable Sample Efficiency from Shifted-Dynamics Data},
author = {Chengrui Qu and Laixi Shi and Kishan Panaganti and Pengcheng You and Adam Wierman},
journal= {arXiv preprint arXiv:2411.03810},
year = {2024}
}