MDP 中面向风险规避与期望值的规划
人工智能
2022-03-11 v2 系统与控制
系统与控制
摘要
马尔可夫决策过程(MDP)中的规划通常优化期望代价。然而,优化期望值并未考虑如下风险:在 MDP 的任意一次运行中,所获得的总代价可能高得不可接受。另一种方法是寻找优化风险规避目标(如条件风险价值(CVaR))的策略。然而,仅优化 CVaR 可能导致期望性能较差。在本工作中,我们首先证明可能存在多个获得最优 CVaR 的策略。这促使我们提出一种词典序方法,其在总代价 CVaR 最优的约束下最小化期望代价。我们给出了该问题的算法,并在四个领域上评估了我们的方法。结果表明,与最先进算法相比,我们的词典序方法在达到最优 CVaR 的同时改善了期望代价。
引用
@article{arxiv.2110.12746,
title = {Planning for Risk-Aversion and Expected Value in MDPs},
author = {Marc Rigter and Paul Duckworth and Bruno Lacerda and Nick Hawes},
journal= {arXiv preprint arXiv:2110.12746},
year = {2022}
}
备注
Accepted to ICAPS 2022