中文

通过历史聚合器构建非马尔可夫决策过程

人工智能 2025-07-01 v1

摘要

在算法决策领域,非马尔可夫动态构成重大障碍,尤其对于强化学习(Reinforcement Learning, RL)等范式,进而深刻影响相关系统的发展与效果。然而,现有基准测试在全面评估决策算法处理非马尔可夫动态能力方面存在不足。为此,我们采用范畴论方法构建了一种通用方法。具体而言,我们建立了马尔可夫决策过程(Markov Decision Process, MDP)范畴与非马尔可夫决策过程(non-Markovian Decision Process, NMDP)范畴,并证明了两者之间的等价关系。这一理论基础为理解和应对非马尔可夫动态提供了新视角。我们进一步通过状态历史聚合器(History Aggregator for State, HAS)将非马尔可夫性引入决策问题设置。运用 HAS,可精确控制决策问题在时间序列中的状态依赖结构。我们的分析表明,该方法在表示广泛的非马尔可夫动态方面有效。该方法通过在显式构建非马尔可夫动态的情境中进行测试,促进了对决策算法进行更严谨且更灵活的评估。

关键词

引用

@article{arxiv.2506.24026,
  title  = {Constructing Non-Markovian Decision Process via History Aggregator},
  author = {Yongyi Wang and Wenxin Li},
  journal= {arXiv preprint arXiv:2506.24026},
  year   = {2025}
}