弱通信与一般平均奖励 MDP 的基于跨度最优样本复杂度
机器学习
2025-02-25 v2 信息论
math.IT
最优化与控制
机器学习
摘要
我们研究了在生成模型下,平均奖励马尔可夫决策过程(MDP)中学习 -最优策略的样本复杂度。对于弱通信 MDP,我们建立了复杂度界 ,其中 是最优策略偏置函数的跨度, 是状态-动作空间的基数。我们的结果是首个在所有参数 、、 和 上达到极小极大最优(至多对数因子)的结果,改进了现有工作中要么假设所有策略具有一致有界混合时间,要么对参数的依赖为次优的不足。我们还开创性地研究了一般(多链)平均奖励 MDP 的样本复杂度。我们论证了一个新的瞬态时间参数 的必要性,建立了 的复杂度界,并证明了一个匹配的(至多对数因子)极小极大下界。这两个结果都基于将平均奖励 MDP 归约为折扣 MDP,这在一般设置中需要新的思路。为最优地分析这一归约,我们为 -折扣 MDP 发展了改进的界,表明在弱通信和一般 MDP 中,分别需要 和 个样本即可学习到 -最优策略。这两个结果都规避了 -折扣 MDP 众所周知的极小极大下界 ,并针对固定的 MDP 实例建立了二次而非三次的时域依赖关系。
引用
@article{arxiv.2403.11477,
title = {Span-Based Optimal Sample Complexity for Weakly Communicating and General Average Reward MDPs},
author = {Matthew Zurek and Yudong Chen},
journal= {arXiv preprint arXiv:2403.11477},
year = {2025}
}
备注
Revision adds Theorem 3 on the difficulty of estimating the span of the optimal bias. arXiv admin note: text overlap with arXiv:2311.13469