中文

马尔可夫决策过程中累积奖励的浓度

机器学习 2025-12-04 v2 系统与控制 系统与控制 机器学习

摘要

本文探讨了马尔可夫决策过程(MDP)中累积奖励的浓度特性,关注其渐近与非渐近情形。我们提出了一种统一方法来刻画 MDP 中的奖励浓度,涵盖无限视域情形(即平均奖励框架和折扣奖励框架)以及有限视域情形。我们的渐近结果包括大数定律、中心极限定律和迭代对数定律,而我们的非渐近界限包括 Azuma-Hoeffding 类型不等式和非渐近版本的迭代对数定律。此外,我们探讨了本文结果的两个关键含义:首先,我们分析了两种固定策略之间奖励差异的样本路径行为;其次,我们表明文献中提出的两种备用奖励定义是相同阶的。我们的证明技术依赖于累积奖励的鞅分解、政策评估固定点方程的性质,以及鞅差序列的渐近与非渐近浓度结果。

关键词

引用

@article{arxiv.2411.18551,
  title  = {Concentration of Cumulative Reward in Markov Decision Processes},
  author = {Borna Sayedana and Peter E. Caines and Aditya Mahajan},
  journal= {arXiv preprint arXiv:2411.18551},
  year   = {2025}
}

备注

71 pages