风险敏感指数代价马尔可夫决策过程中修正策略迭代的收敛性
机器学习
2024-02-16 v2 人工智能
系统与控制
系统与控制
摘要
修正策略迭代(MPI)是一种结合策略迭代与值迭代要素的动力学规划算法。MPI 的收敛性在折扣与平均代价 MDP 背景下已被充分研究。本文考虑指数代价风险敏感 MDP 形式,其已知对模型参数具有一定鲁棒性。尽管策略迭代与值迭代在风险敏感 MDP 中已被深入研究,MPI 尚属空白。我们首次证明在有限状态与动作空间下 MPI 对该风险敏感问题亦收敛。由于指数代价形式处理乘法 Bellman 方程,我们的主要贡献是一套与折扣及风险中性平均代价问题以及风险敏感值与策略迭代方法现有结果迥异的收敛证明。我们以仿真结果收尾,在不同问题参数下评估 MPI 相对值迭代与策略迭代等替代动力学规划方法的性能。结果表明风险敏感 MPI 相较值与策略迭代技术具有更高计算效率。
引用
@article{arxiv.2302.03811,
title = {On the Convergence of Modified Policy Iteration in Risk Sensitive Exponential Cost Markov Decision Processes},
author = {Yashaswini Murthy and Mehrdad Moharrami and R. Srikant},
journal= {arXiv preprint arXiv:2302.03811},
year = {2024}
}
备注
25 pages, 3 figures, Under review at Operations Research