中文

面向平均奖赏 MDP 样本复杂度的紧界

机器学习 2021-06-15 v1 数据结构与算法 最优化与控制

摘要

我们证明了在给定生成模型访问权限下,寻找无限 horizon 平均奖赏马尔可夫决策过程(MDP)的 ϵ\epsilon-最优策略的样本复杂度的新上界与下界。当所有策略的概率转移矩阵混合时间至多为 tmixt_\mathrm{mix} 时,我们提供一种算法,对每个状态-动作对使用 O~(tmixϵ3)\widetilde{O}(t_\mathrm{mix} \epsilon^{-3}) 个(无记忆)样本解决问题。此外,我们给出一个下界,表明在最坏情形下,任何计算无记忆样本的算法对 tmixt_\mathrm{mix} 的线性依赖是必要的。我们通过建立无限 horizon 平均奖赏 MDP 与折扣 MDP 之间的联系获得上述结果,该联系可能具有进一步的效用。

关键词

引用

@article{arxiv.2106.07046,
  title  = {Towards Tight Bounds on the Sample Complexity of Average-reward MDPs},
  author = {Yujia Jin and Aaron Sidford},
  journal= {arXiv preprint arXiv:2106.07046},
  year   = {2021}
}