仅使用离线预训练策略的高效在线强化学习微调
机器学习
2025-05-23 v1 人工智能
机器人学
摘要
通过在线强化学习(RL)提高预训练策略性能是关键且具有挑战性的议题。现有的在线RL微调方法需要继续使用离线预训练Q函数以维持稳定性和性能。然而,这些离线预训练Q函数由于大多数离线RL方法的保守性,常常在超出离线数据集的状态-动作对上低估,从而阻碍了从离线向在线场景的进一步探索。此外,这一要求限制了在仅有预训练策略而无预训练Q函数的场景(如模仿学习(IL)预训练)中的适用性。为解决这些挑战,本文提出一种仅使用离线预训练策略进行高效在线RL微调的方法,消除对预训练Q函数的依赖。我们引入PORL(Policy-Only Reinforcement Learning Fine-Tuning),在在线阶段快速从头初始化Q函数,以避免消极保守。我们的方法不仅在与先进离线到在线RL算法以及利用数据或策略先验的在线RL方法方面取得竞争性能,还开创了直接微调行为克隆(BC)策略的新途径。
引用
@article{arxiv.2505.16856,
title = {Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only},
author = {Wei Xiao and Jiacheng Liu and Zifeng Zhuang and Runze Suo and Shangke Lyu and Donglin Wang},
journal= {arXiv preprint arXiv:2505.16856},
year = {2025}
}