中文

基于残差的离线强化学习

机器学习 2026-04-03 v1 最优化与控制

摘要

离线强化学习(RL)因能够在不与环境交互的情况下从先前收集的数据中学习策略而受到越来越多的关注,这在高风险应用中尤为重要。尽管已有大量工作开发了离线 RL 算法,但这些方法通常依赖于关于数据覆盖的限制性假设,并遭受分布偏移的影响。在本文中,我们提出了一种面向通用状态和动作空间的基于残差的离线 RL 框架。具体而言,我们定义了一个基于残差的贝尔曼最优算子,通过利用经验残差将学习转移动力学中的估计误差显式地纳入策略优化。我们证明了该贝尔曼算子是一个压缩映射,并确定了其不动点渐近最优且具有有限样本保证的条件。我们进一步开发了一种基于残差的离线深度 Q 学习(DQN)算法。利用随机 CartPole 环境,我们展示了所提出的基于残差的离线 DQN 算法的有效性。

关键词

引用

@article{arxiv.2604.01378,
  title  = {Residuals-based Offline Reinforcement Learning},
  author = {Qing Zhu and Xian Yu},
  journal= {arXiv preprint arXiv:2604.01378},
  year   = {2026}
}