Q值估计视角下的离线到在线强化学习
机器学习
2023-12-14 v1 人工智能
摘要
离线到在线强化学习(O2O RL)旨在仅使用少量在线样本来提升离线预训练策略的性能。基于离线RL算法,大多数O2O方法关注RL目标与悲观主义之间的平衡,或离线与在线样本的利用。在本文中,从一个新颖的视角,我们系统地研究了O2O RL中仍然存在的挑战,并指出性能提升缓慢和在线微调不稳定的原因在于离线预训练继承的不准确Q值估计。具体来说,我们证明了估计偏差和Q值的不准确排序为策略更新提供了误导信号,使得标准离线RL算法(如CQL和TD3-BC)在在线微调中失效。基于这一观察,我们通过两种技术解决了Q值估计问题:(1)扰动值更新和(2)增加Q值更新频率。第一种技术平滑了具有尖锐峰值的偏差Q值估计,防止了早期阶段对次优动作的策略利用。第二种技术通过加速学习减轻了从离线预训练继承的估计偏差。在MuJoco和Adroit环境上的大量实验表明,所提出的方法(命名为SO2)显著缓解了Q值估计问题,并持续将性能相对于最先进方法提升高达83.1%。
引用
@article{arxiv.2312.07685,
title = {A Perspective of Q-value Estimation on Offline-to-Online Reinforcement Learning},
author = {Yinmin Zhang and Jie Liu and Chuming Li and Yazhe Niu and Yaodong Yang and Yu Liu and Wanli Ouyang},
journal= {arXiv preprint arXiv:2312.07685},
year = {2023}
}
备注
Accepted at AAAI 2024