中文

通过 Blackwell 折扣因子将 Blackwell 最优与平均最优归约为折扣 MDP

机器学习 2024-07-04 v1

摘要

我们为马尔可夫决策过程(MDPs)引入了 Blackwell 折扣因子。MDP 的经典目标包括折扣最优、平均最优与 Blackwell 最优。许多计算平均最优策略的现有方法通过求解折扣因子接近 11 的折扣最优策略来实现,但它们仅在诸如遍历性或弱通信 MDP 等强假设或难以验证的假设下才有效。本文中,我们证明当折扣因子大于 Blackwell 折扣因子 γbw\gamma_{\mathrm{bw}} 时,所有折扣最优策略都成为 Blackwell 最优与平均最优的,并且我们推导了 γbw\gamma_{\mathrm{bw}} 的一般上界。γbw\gamma_{\mathrm{bw}} 的上界首次在无需任何假设的情况下给出了从平均最优与 Blackwell 最优到折扣最优的归约,并给出了用于平均最优与 Blackwell 最优策略的新的多项式时间算法。我们的工作为 MDP 分析带来了来自多项式与代数数研究的新思想。我们的结果也适用于鲁棒 MDP,从而实现了首个计算鲁棒 Blackwell 最优策略的算法。

关键词

引用

@article{arxiv.2302.00036,
  title  = {Reducing Blackwell and Average Optimality to Discounted MDPs via the Blackwell Discount Factor},
  author = {Julien Grand-Clément and Marek Petrik},
  journal= {arXiv preprint arXiv:2302.00036},
  year   = {2024}
}