约束风险敏感马尔可夫决策过程的近似解
最优化与控制
2023-03-14 v1
摘要
本文考虑为有限状态动作、无限 horizon、约束风险敏感马尔可夫决策过程(CRSMDPs)寻找近最优马尔可夫随机化(MR)策略的问题。约束形式为标准的期望折扣代价函数以及有限与无限 horizon 上的期望风险敏感折扣代价函数。主要贡献在于证明若问题可行则存在解,并提供两种以最终平稳(US)MR 策略形式寻找近似解的方法。后者通过两个近似有限 horizon CRSMDP 实现,它们由原始 CRSMDP 通过对原始目标和约束代价函数作时间截断并适当扰动约束上界构造而来。第一种近似给出一个对原问题 -最优且可行的 US 策略,而第二种近似给出一个近最优 US 策略,其对原始约束的违反被一个指定的 从上界住。证明中的关键一步是适当选取一个度量,使得无限 horizon MR 策略集合与三个 CRSMDP 的可行域紧致,且目标与约束函数连续。还给出了求解近似有限 horizon CRSMDP 的基于线性规划的公式。
引用
@article{arxiv.2209.14963,
title = {Approximate Solutions To Constrained Risk-Sensitive Markov Decision Processes},
author = {Uday Kumar M and Sanjay P Bhat and Veeraruna Kavitha and Nandyala Hemachandra},
journal= {arXiv preprint arXiv:2209.14963},
year = {2023}
}
备注
38 pages