中文

通过TD($\Delta$)对SARSA时间尺度上的动作价值函数进行分段

机器学习 2025-09-05 v4

摘要

在众多基于SARSA的无限期强化学习(RL)环境中,这些方法被用于增强旨在长时间尺度上最大化回报的策略。传统SARSA算法因其依赖单一恒定折扣因子(η\eta)而难以在偏差和方差之间实现最佳平衡。本研究通过将时序差分分解方法TD(Δ\Delta)应用于SARSA算法,称为SARSA(Δ\Delta)。SARSA是一种广泛使用的在策略RL方法,通过时序差更新来增强动作价值函数。通过将动作价值函数分解为与特定折扣因子相关的组件,SARSA(Δ\Delta)实现了在多种时间尺度上的学习。这种分析使学习更有效,尤其在需要长期改进的情境下保持一致性。该研究结果表明,所提出的策略在降低SARSA更新的偏差方面有效,并加快了在确定性和随机环境中以及密集奖励Atari环境中的收敛速度。来自多种基准设置的实验结果表明,所提出的SARSA(Δ\Delta)在表格和深度RL环境中均优于现有TD学习技术。

关键词

引用

@article{arxiv.2411.14783,
  title  = {Segmenting Action-Value Functions Over Time-Scales in SARSA via TD($\Delta$)},
  author = {Mahammad Humayoo},
  journal= {arXiv preprint arXiv:2411.14783},
  year   = {2025}
}

备注

25 pages. arXiv admin note: text overlap with arXiv:2411.14019