通过锚定实现 MDP 的近最优样本复杂度
最优化与控制
2025-06-16 v2 数据结构与算法
摘要
我们研究了一种新的无模型算法,用于在弱连通情况下计算平均报酬马尔可夫决策过程的 -最优策略。给定一个生成模型,我们的过程将递归采样技术与 Halpern 的锚定迭代相结合,并在高概率和期望意义下以 的样本和时间复杂度计算出 -最优策略。据我们所知,这是无模型算法中的最佳复杂度,与已知的下界相匹配,仅相差一个 因子。尽管复杂度界限涉及未知偏差向量的跨度半范数 ,但该算法不需要先验知识,并实现了一个停止规则,以概率 1 保证该过程在有限时间内终止。我们还分析了如何将这些技术应用于折扣 MDP。
引用
@article{arxiv.2502.04477,
title = {Near-Optimal Sample Complexity for MDPs via Anchoring},
author = {Jongmin Lee and Mario Bravo and Roberto Cominetti},
journal= {arXiv preprint arXiv:2502.04477},
year = {2025}
}