折扣型有限马尔可夫决策过程的转坡函数性质
最优化与控制
2025-07-15 v2
摘要
本文研究折扣马尔可夫决策过程 (MDP),其状态和动作集合均为有限集。价值迭代是寻找最优策略的主要方法之一。对于每个折扣因子, starting from 一个有限的迭代次数(称为转坡整数),价值迭代算法总会生成决策规则,即针对无限期问题的确定性最优政策。这一事实合理地支持了通过进行有限次价值迭代来计算无限期最优政策的滚动时段方法。本文描述了转坡整数的性质并给出了上界。
引用
@article{arxiv.2502.05375,
title = {Properties of Turnpike Functions for Discounted Finite MDPs},
author = {Eugene A. Feinberg and Gaojin He},
journal= {arXiv preprint arXiv:2502.05375},
year = {2025}
}