中文

弱通信与一般平均奖励 MDP 的基于跨度最优样本复杂度

机器学习 2025-02-25 v2 信息论 math.IT 最优化与控制 机器学习

摘要

我们研究了在生成模型下,平均奖励马尔可夫决策过程(MDP)中学习 ε\varepsilon-最优策略的样本复杂度。对于弱通信 MDP,我们建立了复杂度界 O~(SAHε2)\widetilde{O}(SA\frac{H}{\varepsilon^2}),其中 HH 是最优策略偏置函数的跨度,SASA 是状态-动作空间的基数。我们的结果是首个在所有参数 SSAAHHε\varepsilon 上达到极小极大最优(至多对数因子)的结果,改进了现有工作中要么假设所有策略具有一致有界混合时间,要么对参数的依赖为次优的不足。我们还开创性地研究了一般(多链)平均奖励 MDP 的样本复杂度。我们论证了一个新的瞬态时间参数 BB 的必要性,建立了 O~(SAB+Hε2)\widetilde{O}(SA\frac{B + H}{\varepsilon^2}) 的复杂度界,并证明了一个匹配的(至多对数因子)极小极大下界。这两个结果都基于将平均奖励 MDP 归约为折扣 MDP,这在一般设置中需要新的思路。为最优地分析这一归约,我们为 γ\gamma-折扣 MDP 发展了改进的界,表明在弱通信和一般 MDP 中,分别需要 O~(SAH(1γ)2ε2)\widetilde{O}(SA\frac{H}{(1-\gamma)^2\varepsilon^2})O~(SAB+H(1γ)2ε2)\widetilde{O}(SA\frac{B + H}{(1-\gamma)^2\varepsilon^2}) 个样本即可学习到 ε\varepsilon-最优策略。这两个结果都规避了 γ\gamma-折扣 MDP 众所周知的极小极大下界 Ω~(SA1(1γ)3ε2)\widetilde{\Omega}(SA\frac{1}{(1-\gamma)^3\varepsilon^2}),并针对固定的 MDP 实例建立了二次而非三次的时域依赖关系。

关键词

引用

@article{arxiv.2403.11477,
  title  = {Span-Based Optimal Sample Complexity for Weakly Communicating and General Average Reward MDPs},
  author = {Matthew Zurek and Yudong Chen},
  journal= {arXiv preprint arXiv:2403.11477},
  year   = {2025}
}

备注

Revision adds Theorem 3 on the difficulty of estimating the span of the optimal bias. arXiv admin note: text overlap with arXiv:2311.13469