中文

SOReL与TOReL:两种完全离线强化学习方法

机器学习 2025-06-02 v2 人工智能

摘要

样本效率仍是强化学习(RL)在现实世界中应用的主要障碍:其成功仅限于模拟器提供几乎无限环境交互的设定,而在现实中获取这些交互通常成本高昂或具有危险性。离线 RL 原则上通过利用离线数据在部署前学习近似最优策略来提供解决方案。然而在实践中,当前的离线 RL 方法依赖大量在线交互进行超参数调优,且对其初始在线性能没有可靠的界限。为解决这两个问题,我们引入了两种算法。首先是 SOReL:一种用于安全离线强化学习的算法。仅使用离线数据,我们的贝叶斯方法推断环境动力学的后验,通过后验预测不确定性获得在线性能的可靠估计。关键在于,所有超参数也完全离线调优。其次,我们引入 TOReL:一种离线强化学习算法的调优方法,将我们基于信息率的离线超参数调优方法扩展至一般的离线 RL 方法。我们的实证评估证实了 SOReL 在贝叶斯设定下准确估计遗憾的能力,同时 TOReL 的离线超参数调优仅使用离线数据即可与最佳在线超参数调优方法取得具有竞争力的性能。因此,SOReL 和 TOReL 朝着安全可靠的离线 RL 迈出了重要一步,解锁了 RL 在现实世界中的潜力。我们的实现已公开:https://github.com/CWibault/sorel_torel。

关键词

引用

@article{arxiv.2505.22442,
  title  = {SOReL and TOReL: Two Methods for Fully Offline Reinforcement Learning},
  author = {Mattie Fellows and Clarisse Wibault and Uljad Berdica and Johannes Forkel and Michael A. Osborne and Jakob N. Foerster},
  journal= {arXiv preprint arXiv:2505.22442},
  year   = {2025}
}