关于吸收马尔可夫决策过程的进一步注记
最优化与控制
2024-09-12 v2 概率论
摘要
在本注记中,基于Dufour和Prieto-Rumeau最近的重要结果,我们推导出对于给定初始状态的吸收MDP,在标准紧性-连续性条件下,占据测度空间在赋予弱拓扑和弱-强拓扑时具有相同的收敛序列。我们提供了两个例子,表明所施加的条件不能被其流行的替代条件所取代,并且上述断言对于状态空间上占据测度的边际空间不成立。此外,这些例子也澄清了先前文献中的一些结果。
关键词
引用
@article{arxiv.2403.20292,
title = {Further remarks on absorbing Markov decision processes},
author = {Yi Zhang and Xinran Zheng},
journal= {arXiv preprint arXiv:2403.20292},
year = {2024}
}