中文

不确定马尔可夫决策过程中用于鲁棒规划的极小极大后悔优化

人工智能 2023-02-14 v2

摘要

马尔可夫决策过程(MDP)的参数往往无法精确指定。不确定 MDP(UMDP)通过定义参数所属的集合来刻画这种模型模糊性。极小极大后悔已被提出作为 UMDP 中规划的 objective,以寻找不过度保守的鲁棒策略。本文关注具有不确定代价与转移函数的随机最短路径(SSP)UMDP 的规划。我们引入一个 Bellman 方程来计算策略的后悔值。我们提出一种利用该后悔 Bellman 方程的动态规划算法,并证明其对具有独立不确定性的 UMDP 能精确优化极小极大后悔。对于耦合不确定性,我们扩展该方法以使用 options 来权衡计算量与解质量。我们在合成与真实领域上评估了该方法,显示其显著优于现有基线。

关键词

引用

@article{arxiv.2012.04626,
  title  = {Minimax Regret Optimisation for Robust Planning in Uncertain Markov Decision Processes},
  author = {Marc Rigter and Bruno Lacerda and Nick Hawes},
  journal= {arXiv preprint arXiv:2012.04626},
  year   = {2023}
}

备注

Full version of AAAI 2021 paper, with corrigendum attached that describes error in original paper