中文

基于状态-动作条件离线模型引导的离线到在线强化学习:SAMG

机器学习 2025-02-24 v2 人工智能

摘要

离线到在线(O2O)强化学习(RL)在离线数据上预训练模型,然后通过在线微调来优化策略。然是,现有的 O2O RL 算法通常需要维持繁琐的离线数据集来缓解离分布(OOD)数据的影响,这显著限制了其在利用在线样本方面的效率。为此,我们引入一种新的 O2O RL 范式,称为基于状态-动作条件离线模型引导(SAMG)。它冻结预训练的离线 critic 以为每个状态-动作样本提供紧凑的离线理解,从而消除对离线数据重训练的需求。该冻结的离线 critic 与在线目标 critic 结合,权重为基于状态-动作自适应系数。该系数旨在捕捉样本在状态-动作水平上的离线程度,在训练期间自适应更新。在实际中,SAMG 可以轻松集成到基于 Q 函数的算法中。理论分析表明其具有良好的最优性和较低的估计误差。经验上,SAMG 在 D4RL 基准上优于最新的 O2O RL 算法。

关键词

引用

@article{arxiv.2410.18626,
  title  = {SAMG: Offline-to-Online Reinforcement Learning via State-Action-Conditional Offline Model Guidance},
  author = {Liyu Zhang and Haochi Wu and Xu Wan and Quan Kong and Ruilong Deng and Mingyang Sun},
  journal= {arXiv preprint arXiv:2410.18626},
  year   = {2025}
}