中文

基于Allan方差的平均奖励非平稳强化学习

机器学习 2025-04-24 v1 机器学习

摘要

我们考虑的是在无限时域平均奖励setting下的非平稳强化学习(RL)问题。我们通过具有时变奖励和转移概率的马尔可夫决策过程(MDP)来建模,其变动预算为ΔT\Delta_T。现有非平稳RL算法侧重于基于模型和无模型的价值基方法。尽管基于策略的方法在实际中具有灵活性,但在非平稳RL中缺乏理论阐述。我们提出并分析了第一个无模型基于策略的算法,非平稳自然演员-评论家(NS-NAC),这是一种基于变更的重启式策略梯度方法,并提出学习率作为适应因子的新解释。进一步,我们提出了一个基于bandit-over-RL的参数自由算法BORL-NS-NAC,不需要对变动预算ΔT\Delta_T的先验知识。我们给出两种算法的动态 regret为O~(S1/2A1/2ΔT1/6T5/6)\tilde{\mathscr O}(|S|^{1/2}|A|^{1/2}\Delta_T^{1/6}T^{5/6}),其中T为时间范围,|S|、|A|分别为状态和动作空间的大小。regrent分析利用了将NAC的Lyapunov函数分析适应到动态环境的新方法,并刻画了策略、价值函数估计和环境变化同时更新的影响。

关键词

引用

@article{arxiv.2504.16415,
  title  = {Natural Policy Gradient for Average Reward Non-Stationary RL},
  author = {Neharika Jali and Eshika Pathak and Pranay Sharma and Guannan Qu and Gauri Joshi},
  journal= {arXiv preprint arXiv:2504.16415},
  year   = {2025}
}