中文

一种简洁统一的 Uncertainty 引导离线到在线强化学习框架

机器学习 2026-01-19 v3 人工智能

摘要

离线强化学习(RL)提供了一种完全依赖数据驱动范式来学习智能体的有前景的方案。然而,受限于离线数据集的有限质量,其性能往往次优。因此,期望在部署前通过额外的在线交互进一步微调智能体。遗憾的是,离线到在线 RL 可能因两大挑战而十分困难:受限的探索行为与状态-动作分布偏移。鉴于此,我们提出了一种简洁统一的 Uncertainty 引导(SUNG)框架,它借助不确定性工具自然地将这两大挑战的解决方式统一起来。具体而言,SUNG 通过基于 VAE 的状态-动作访问密度估计器来量化不确定性。为促进高效探索,SUNG 提出了一种实用的乐观探索策略,以选取兼具高价值与高不确定性的信息量动作。此外,SUNG 开发了一种自适应利用方法,将对高不确定性样本施加保守离线 RL 目标、对低不确定性样本施加标准在线 RL 目标,从而平滑地衔接离线阶段与在线阶段。当与不同离线 RL 方法结合时,SUNG 在 D4RL 基准的各类环境与数据集上取得了最先进的在线微调性能。代码已公开于 https://github.com/guosyjlu/SUNG。

关键词

引用

@article{arxiv.2306.07541,
  title  = {A Simple Unified Uncertainty-Guided Framework for Offline-to-Online Reinforcement Learning},
  author = {Siyuan Guo and Yanchao Sun and Jifeng Hu and Sili Huang and Hechang Chen and Haiyin Piao and Lichao Sun and Yi Chang},
  journal= {arXiv preprint arXiv:2306.07541},
  year   = {2026}
}

备注

The final published version is available at IEEE Xplore: https://ieeexplore.ieee.org/abstract/document/11267513/. We correct the GitHub repo url in this version