中文

强化学习中的非平稳与可变折扣马尔可夫决策过程

机器学习 2025-12-03 v2 最优化与控制 机器学习

摘要

在非平稳环境中运行的算法,以及面向有限时限任务的无限时限表述,常面临挑战。为此,我们引入非平稳可变折扣马尔可夫决策过程 (NVMDP) 框架,该框架自然适应非平稳性,并允许折扣率随时间和转移而变化。无限时限、平稳 MDP 可视为 NVMDP 的特例,用于识别最优策略;有限时限 MDP 也被纳入 NVMDP 的表述之中。此外,NVMDP 提供灵活的机制,可在不改变状态空间、动作空间或奖励结构的情况下塑造最优策略。我们建立了 NVMDP 的理论基础,包括假设条件、状态价值与动作价值表述及递归、矩阵表示、最优性条件以及有限状态和动作空间下的策略改进。基于这些结果,我们将动态编程和广义 Q 学习算法适用于 NVMDP,并给出形式收敛证明。对于需要函数逼近的问题,我们扩展了策略梯度定理以及信任区间策略优化 (TRPO) 中的策略改进界,给出标量形式和矩阵形式的证明。在非平稳格子世界环境中进行的经验评估表明,NVMDP 基于算法在多种奖励和折扣方案下成功恢复最优轨迹,而原始 Q 学习则失败。这些结果整体表明,NVMDP 提供了一个在理论上严谨且在实践中高效的强化学习框架,仅需轻微的算法修改即可实现对非平稳性的稳健处理以及对最优策略的显式塑造。

关键词

引用

@article{arxiv.2511.17598,
  title  = {Non-stationary and Varying-discounting Markov Decision Processes for Reinforcement Learning},
  author = {Zhizuo Chen and Theodore T. Allen},
  journal= {arXiv preprint arXiv:2511.17598},
  year   = {2025}
}

备注

Code: https://github.com/zhizuo-chen/jupyter-notebook/tree/main/NVMDP