中文

通过锚定实现 MDP 的近最优样本复杂度

最优化与控制 2025-06-16 v2 数据结构与算法

摘要

我们研究了一种新的无模型算法,用于在弱连通情况下计算平均报酬马尔可夫决策过程的 ε\varepsilon-最优策略。给定一个生成模型,我们的过程将递归采样技术与 Halpern 的锚定迭代相结合,并在高概率和期望意义下以 O~(SAhsp2/ε2)\widetilde{O}(|\mathcal{S}||\mathcal{A}|\|h^*\|_{\text{sp}}^{2}/\varepsilon^{2}) 的样本和时间复杂度计算出 ε\varepsilon-最优策略。据我们所知,这是无模型算法中的最佳复杂度,与已知的下界相匹配,仅相差一个 hsp\|h^*\|_{\text{sp}} 因子。尽管复杂度界限涉及未知偏差向量的跨度半范数 hsp\|h^*\|_{\text{sp}},但该算法不需要先验知识,并实现了一个停止规则,以概率 1 保证该过程在有限时间内终止。我们还分析了如何将这些技术应用于折扣 MDP。

关键词

引用

@article{arxiv.2502.04477,
  title  = {Near-Optimal Sample Complexity for MDPs via Anchoring},
  author = {Jongmin Lee and Mario Bravo and Roberto Cominetti},
  journal= {arXiv preprint arXiv:2502.04477},
  year   = {2025}
}