面向平均奖赏 MDP 样本复杂度的紧界
机器学习
2021-06-15 v1 数据结构与算法
最优化与控制
摘要
我们证明了在给定生成模型访问权限下,寻找无限 horizon 平均奖赏马尔可夫决策过程(MDP)的 -最优策略的样本复杂度的新上界与下界。当所有策略的概率转移矩阵混合时间至多为 时,我们提供一种算法,对每个状态-动作对使用 个(无记忆)样本解决问题。此外,我们给出一个下界,表明在最坏情形下,任何计算无记忆样本的算法对 的线性依赖是必要的。我们通过建立无限 horizon 平均奖赏 MDP 与折扣 MDP 之间的联系获得上述结果,该联系可能具有进一步的效用。
引用
@article{arxiv.2106.07046,
title = {Towards Tight Bounds on the Sample Complexity of Average-reward MDPs},
author = {Yujia Jin and Aaron Sidford},
journal= {arXiv preprint arXiv:2106.07046},
year = {2021}
}