中文

分数策略梯度:融合长期记忆的强化学习框架

机器学习 2025-07-02 v1 机器学习

摘要

我们提出了分数策略梯度(FPG),这是一种融合分数计算的强化学习框架,用于策略优化中的长期时序建模。标准策略梯度方法受马尔可夫假设的限制,表现出高方差和低效抽样。通过采用卡普托分数导数来重构梯度,FPG在状态转换之间建立了幂律时序相关性。我们 developed an efficient recursive computation technique for fractional temporal-difference errors with constant time and memory requirements.理论分析表明,FPG相对于标准策略梯度实现了O(t^(-alpha))阶的渐近方差降低,同时保持收敛性。经验验证表明,FPG相对于最先进的基准方法实现了35-68%的样本效率提升和24-52%的方差降低。这一框架提供了一种在不增加计算开销的情况下利用长程依赖性的数学依据方法。

关键词

引用

@article{arxiv.2507.00073,
  title  = {Fractional Policy Gradients: Reinforcement Learning with Long-Term Memory},
  author = {Urvi Pawar and Kunal Telangi},
  journal= {arXiv preprint arXiv:2507.00073},
  year   = {2025}
}

备注

Submitted to Journal of Machine Learning Research (JMLR), June 2025. 24 pages, 3 figures. Under review