超越折扣回报:具有平均与 Blackwell 最优性的鲁棒 Markov 决策过程
最优化与控制
2025-01-15 v3 计算机科学与博弈论
摘要
鲁棒 Markov 决策过程 (RMDP) 是在参数不确定性下进行序贯决策的广泛使用框架。当目标是最大化折扣回报时,RMDP 已被广泛研究,但对于平均最优性(优化随时间获得的奖励的长期平均值)和 Blackwell 最优性(对于所有足够接近 1 的折扣因子保持折扣最优),人们却知之甚少。在本文中,我们证明了折扣回报之外的 RMDP 的几个基础性结果。我们表明,对于 sa-rectangular RMDP,平均最优策略可以被选为平稳且确定性的,但令人惊讶的是,对于 s-rectangular RMDP,平均最优策略可能不存在,即使存在,也可能需要依赖于历史。我们还研究了 sa-rectangular RMDP 的 Blackwell 最优性,其中我们表明 -Blackwell 最优策略总是存在的,尽管 Blackwell 最优策略可能不存在。我们还提供了它们存在的一个充分条件,该条件几乎涵盖了文献中的任何例子。然后我们讨论了平均最优性和 Blackwell 最优性之间的联系,并描述了几种计算最优平均回报的算法。有趣的是,我们的方法利用了 RMDP 与随机博弈之间的联系。总体而言,我们的论文强调了基于距离的 sa-rectangular 模型在平均和 Blackwell 最优性方面相较于 s-rectangular 模型的优越实际特性。
引用
@article{arxiv.2312.03618,
title = {Beyond discounted returns: Robust Markov decision processes with average and Blackwell optimality},
author = {Julien Grand-Clément and Marek Petrik and Nicolas Vieille},
journal= {arXiv preprint arXiv:2312.03618},
year = {2025}
}