平均成本 MDPs 于无限状态与动作集合:关于最优不等式与方程的新充分条件
最优化与控制
2025-01-28 v2
摘要
本文研究离散时间平均成本的无限时域马尔可夫决策过程(MDPs),其状态与动作集合为伯罗利集合。文中引入新的充分条件,以确保弱连续或集合方式连续转移概率下的最优不等式与最优方程的有效性。这些不等式与方程蕴含确定性最优策略的存在。
引用
@article{arxiv.2412.01594,
title = {Average-Cost MDPs with Infinite State and Action Sets: New Sufficient Conditions for Optimality Inequalities and Equations},
author = {Eugene A. Feinberg and Pavlo O. Kasyanov and Liliia S. Paliichuk},
journal= {arXiv preprint arXiv:2412.01594},
year = {2025}
}