坐标上升与动态规划求解多模型 MDP
机器学习
2025-07-15 v1 人工智能
摘要
多模型马尔可夫决策过程(MMDP)是一个针对 MDP 参数不确定性寻找鲁棒策略的有前景的框架。MMDP 旨在寻找一种策略,以最大化在多个 MDP 模型分布上的期望回报。由于 MMDP 求解是 NP-hard 的,大多数方法都依赖于近似。在本文中,我们推导了 MMDP 的策略梯度,并提出了 CADP 算法,将坐标上升方法与动态规划算法相结合来求解 MMDP。与早期算法相比,CADP 的主要创新在于从坐标上升角度出发,迭代调整模型权重以保证策略在局部最大值上的单调改进。对 CADP 的理论分析证明其永远不会比先前的动态规划算法(如 WSU)差。我们的numerical结果表明,CADP 在多个基准问题上显著优于现有方法。
引用
@article{arxiv.2407.06329,
title = {Solving Multi-Model MDPs by Coordinate Ascent and Dynamic Programming},
author = {Xihong Su and Marek Petrik},
journal= {arXiv preprint arXiv:2407.06329},
year = {2025}
}
备注
Accepted at UAI 2023