中文

双 Successive Over-Relaxation Q 学习算法及其深度强化学习扩展

机器学习 2025-07-01 v2 人工智能

摘要

Q 学习是强化学习(RL)中广泛使用的数据算法,但当折扣因子接近 1 时,其收敛速度可能较慢。引入松弛因子以加快收敛速度的 Successive Over-Relaxation (SOR) Q 学习算法虽解决了这一问题,但存在两个主要局限性: 在表格设置下,松弛参数依赖于转移概率,因而并非完全模型自由; 且存在过估计偏差。为克服这些局限性,我们提出了一种基于样本的、模型自由的双 SOR Q 学习算法。理论上和实验上,该算法显示优于 SOR Q 学习,偏差更小。进一步,在表格设置下,讨论了在迭代值有界性假设下的收敛分析。该算法通过深度 RL 被扩展以处理大规模问题。最后,比较了表格版本算法使用 roulette 和网格世界环境,而深度 RL 版本则在最大化偏差示例和 OpenAI Gym 环境中进行测试。

关键词

引用

@article{arxiv.2409.06356,
  title  = {Double Successive Over-Relaxation Q-Learning with an Extension to Deep Reinforcement Learning},
  author = {Shreyas S R},
  journal= {arXiv preprint arXiv:2409.06356},
  year   = {2025}
}