面向在线强化学习的离线重训练:解耦策略学习以缓解探索偏差
机器学习
2023-10-13 v1 人工智能
机器人学
摘要
在在线强化学习(RL)或微调过程中,策略乐观地探索新状态和行为是可取的,尤其当先前的离线数据未提供足够状态覆盖时。然而,探索奖励会偏置所学策略,且我们的实验发现此类奖励的朴素但标准的使用可能未能恢复高性能策略。同时,离线 RL 中的悲观训练已能从静态数据集中恢复高性能策略。我们能否利用离线 RL 从在线交互中恢复更好的策略?我们提出一个简单观察:可用悲观目标从零开始在全部交互数据上训练策略,从而解耦用于数据收集和用于评估的策略。具体而言,我们提出离线重训练,即在我们的离线到在线到离线(OOO)强化学习框架中在线微调结束时的一个策略提取步骤。一个乐观(探索)策略用于与环境交互,一个独立的悲观(利用)策略在所有观测数据上训练以用于评估。此种解耦可减少评估策略中来自在线交互(内在奖励、首要偏差)的任何偏差,并允许在线交互中更具探索性的行为,这反过来可生成更好的利用数据。OOO 与多种离线到在线 RL 和在线 RL 方法互补,在我们的微调实验中将其平均性能提升 14% 至 26%,在 D4RL 基准的若干环境上达到最先进性能,并在两个 OpenAI gym 环境上将在线 RL 性能提升 165%。此外,OOO 能从不完整离线数据集微调,而先前方法可能未能恢复高性能策略。实现:https://github.com/MaxSobolMark/OOO
引用
@article{arxiv.2310.08558,
title = {Offline Retraining for Online RL: Decoupled Policy Learning to Mitigate Exploration Bias},
author = {Max Sobol Mark and Archit Sharma and Fahim Tajwar and Rafael Rafailov and Sergey Levine and Chelsea Finn},
journal= {arXiv preprint arXiv:2310.08558},
year = {2023}
}