通过TD($\Delta$)对SARSA时间尺度上的动作价值函数进行分段
机器学习
2025-09-05 v4
摘要
在众多基于SARSA的无限期强化学习(RL)环境中,这些方法被用于增强旨在长时间尺度上最大化回报的策略。传统SARSA算法因其依赖单一恒定折扣因子()而难以在偏差和方差之间实现最佳平衡。本研究通过将时序差分分解方法TD()应用于SARSA算法,称为SARSA()。SARSA是一种广泛使用的在策略RL方法,通过时序差更新来增强动作价值函数。通过将动作价值函数分解为与特定折扣因子相关的组件,SARSA()实现了在多种时间尺度上的学习。这种分析使学习更有效,尤其在需要长期改进的情境下保持一致性。该研究结果表明,所提出的策略在降低SARSA更新的偏差方面有效,并加快了在确定性和随机环境中以及密集奖励Atari环境中的收敛速度。来自多种基准设置的实验结果表明,所提出的SARSA()在表格和深度RL环境中均优于现有TD学习技术。
引用
@article{arxiv.2411.14783,
title = {Segmenting Action-Value Functions Over Time-Scales in SARSA via TD($\Delta$)},
author = {Mahammad Humayoo},
journal= {arXiv preprint arXiv:2411.14783},
year = {2025}
}
备注
25 pages. arXiv admin note: text overlap with arXiv:2411.14019