离线到在线强化学习的三大范式
机器学习
2026-02-03 v3 人工智能
摘要
离线到在线强化学习(RL)已成为一种实用范式,利用离线数据进行预训练,再通过在线交互进行微调。然而,其实证行为高度不一致:在一种设置下效果良好的在线微调设计选择,在另一种情况下却会完全失败。我们提出一种稳定性—塑性原则,以解释这种不一致性:在在线微调期间,应保留预训练策略或离线数据集中更好的知识,同时保持足够的塑性。从这个角度看,本文识别出在线微调的三种范式,每种范式都需要不同的稳定性属性。我们通过大规模实证研究验证了这一框架,发现结果在 45 个案例中强烈符合预测,仅有 3 个相反的不匹配。本工作提供了一种以离线数据集和预训练策略相对性能为依据的,指导离线到在线 RL 设计选择的原则框架。
引用
@article{arxiv.2510.01460,
title = {The Three Regimes of Offline-to-Online Reinforcement Learning},
author = {Lu Li and Tianwei Ni and Yihao Sun and Pierre-Luc Bacon},
journal= {arXiv preprint arXiv:2510.01460},
year = {2026}
}