中文

高效在线强化学习微调无需保留离线数据

机器学习 2025-07-03 v3

摘要

机器学习的现代范式涉及在多样化数据上进行预训练,然后进行特定任务的微调。在强化学习(RL)中,这等价于在多样化的历史数据集上进行离线学习,然后通过交互数据进行快速在线RL微调。大多数RL微调方法需要在离线数据上继续训练以获得稳定性和性能。然而,这不可取,因为在大型数据集上进行离线数据训练耗时且昂贵,并且原则上也限制了可能的性能提升,因为离线数据的约束或乐观主义。本文表明,只要使用设计恰当的在线RL方法进行离线RL初始化的微调,便无需保留离线数据。为构建这一方法,我们通过分析保留离线数据在在线微调中的作用。我们发现,离线数据的持续训练主要用于防止在微调开始时因离线数据与在线 rollout 之间分布不匹配而导致价值函数突然发散。这种发散通常会导致遗忘离线预训练的好处。我们的 methods 使用一种非常简单的想法来缓解预训练初始化的灾难性遗忘。WSRL采用一种热身阶段,该阶段使用来自预训练策略的少量 rollout 来进行快速在线RL。热身期间收集的数据有助于“重新校准”离线 Q 函数以匹配在线分布,从而允许我们在不稳定在线RL微调的情况下完全丢弃离线数据。我们表明,WSRL能够在不保留任何离线数据的情况下进行微调,并且能够比现有算法更快地学习并获得更高的性能,无论它们是否保留离线数据。

关键词

引用

@article{arxiv.2412.07762,
  title  = {Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data},
  author = {Zhiyuan Zhou and Andy Peng and Qiyang Li and Sergey Levine and Aviral Kumar},
  journal= {arXiv preprint arXiv:2412.07762},
  year   = {2025}
}