通过不确定性与平滑性实现鲁棒的离线到在线强化学习
机器学习
2024-11-18 v2
摘要
为以更少的交互在强化学习(RL)中获得近最优策略,一种有前景的方法是将离线 RL(通过利用离线数据集提升样本效率)与在线 RL(通过与环境的互动探索信息量大的转移)相结合。离线到在线(Offline-to-Online, O2O) RL 提供了一种在有限在线交互内改进离线训练智能体的范式。然而,由于在线经验与离线数据之间存在显著的分布式偏移(distribution shift),大多数离线 RL 算法在 O2O 适配中出现性能下降,无法实现稳定的策略改进。为解决该问题,我们提出了鲁棒离线到在线(RO2O)算法,旨在通过不确定性与平滑性增强离线策略,并缓解在线适配中的性能下降。具体而言,RO2O 引入 Q-集成(Q-ensemble)用于不确定性惩罚,以及对抗样本用于策略与价值平滑,使 RO2O 在在线适配中保持一致的学习过程,而无需对学习目标作特殊改动。在线性 MDP 中的理论分析表明,相较于分布式偏移,不确定性与平滑性在 O2O 中带来了更紧的最优性界。实验结果说明了 RO2O 在促进稳定离线到在线学习以及以有限在线交互取得显著提升方面的优越性。
引用
@article{arxiv.2309.16973,
title = {Towards Robust Offline-to-Online Reinforcement Learning via Uncertainty and Smoothness},
author = {Xiaoyu Wen and Xudong Yu and Rui Yang and Haoyuan Chen and Chenjia Bai and Zhen Wang},
journal= {arXiv preprint arXiv:2309.16973},
year = {2024}
}
备注
This paper has been accepted by Journal of Artificial Intelligence Research (JAIR). arXiv admin note: text overlap with arXiv:2306.06871 by other authors