基于Allan方差的平均奖励非平稳强化学习
机器学习
2025-04-24 v1 机器学习
摘要
我们考虑的是在无限时域平均奖励setting下的非平稳强化学习(RL)问题。我们通过具有时变奖励和转移概率的马尔可夫决策过程(MDP)来建模,其变动预算为。现有非平稳RL算法侧重于基于模型和无模型的价值基方法。尽管基于策略的方法在实际中具有灵活性,但在非平稳RL中缺乏理论阐述。我们提出并分析了第一个无模型基于策略的算法,非平稳自然演员-评论家(NS-NAC),这是一种基于变更的重启式策略梯度方法,并提出学习率作为适应因子的新解释。进一步,我们提出了一个基于bandit-over-RL的参数自由算法BORL-NS-NAC,不需要对变动预算的先验知识。我们给出两种算法的动态 regret为,其中T为时间范围,|S|、|A|分别为状态和动作空间的大小。regrent分析利用了将NAC的Lyapunov函数分析适应到动态环境的新方法,并刻画了策略、价值函数估计和环境变化同时更新的影响。
引用
@article{arxiv.2504.16415,
title = {Natural Policy Gradient for Average Reward Non-Stationary RL},
author = {Neharika Jali and Eshika Pathak and Pranay Sharma and Guannan Qu and Gauri Joshi},
journal= {arXiv preprint arXiv:2504.16415},
year = {2025}
}