面向通用离线-在线强化学习的乐观评论家重构与受约束微调
机器学习
2024-12-30 v1
摘要
离线-在线(offline-to-online, O2O)强化学习(RL)提供了一种有效的方法,利用离线预训练策略作为初始化,以获得有限的在线交互即可实现性能快速提升。近期研究常为特定的离线RL方法设计微调策略,无法对来自任何离线方法的通用O2O学习。为此,我们揭示了离线数据集与在线环境之间存在评估和改进上的不匹配,这阻碍了将预训练策略直接应用于在线微调。为此,本文提出了同时处理这两种不匹配的方法,旨在实现从任何离线方法到任何在线方法的通用O2O学习。在在线微调之前,我们以乐观方式重新评估在离线数据集上悲观训练的评论家,然后通过可靠的离线演员校准不匹配的评论家,以避免错误更新。获得乐观且一致的评论家后,我们进行受约束的微调,以应对在线学习期间的分布迁移。我们通过实验表明,与最新方法相比,我们提出的方法在多个模拟任务上实现了稳定且高效的性能提升。
引用
@article{arxiv.2412.18855,
title = {Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL},
author = {Qin-Wen Luo and Ming-Kun Xie and Ye-Wen Wang and Sheng-Jun Huang},
journal= {arXiv preprint arXiv:2412.18855},
year = {2024}
}
备注
Accepted to Neurips 2024