中文

Q学习是极小极大最优的吗?一个紧致的样本复杂度分析

机器学习 2025-03-18 v4 信息论 机器学习 math.IT 最优化与控制 统计理论 统计理论

摘要

Q学习以无模型方式寻求学习马尔可夫决策过程(MDP)的最优Q函数,位于强化学习的核心。在同步设定下(即每次迭代中从生成模型抽取所有状态-动作对的独立样本),理解Q学习的样本效率已取得实质性进展。考虑一个具有状态空间S\mathcal{S}和动作空间A\mathcal{A}γ\gamma-折扣无限 horizon(无限期)MDP:为获得最优Q函数的逐项ε\varepsilon近似,Q学习的当前最优理论要求样本量超过SA(1γ)5ε2\frac{|\mathcal{S}||\mathcal{A}|}{(1-\gamma)^5\varepsilon^{2}}阶,未能匹配现有的极小极大下界。这引出了自然的问题:Q学习的精确样本复杂度是什么?Q学习是否被证明是次优的?本文针对同步设定解决这些问题:(1)当A=1|\mathcal{A}|=1时(此时Q学习退化为TD学习),我们证明TD学习的样本复杂度是极小极大最优的,且按S(1γ)3ε2\frac{|\mathcal{S}|}{(1-\gamma)^3\varepsilon^2}缩放(至多差对数因子);(2)当A2|\mathcal{A}|\geq 2时,我们确定Q学习的样本复杂度阶为SA(1γ)4ε2\frac{|\mathcal{S}||\mathcal{A}|}{(1-\gamma)^4\varepsilon^2}(至多差对数因子)。我们的理论揭示了当A2|\mathcal{A}|\geq 2时Q学习的严格次优性,并严谨化了Q学习中过高估计的负面影响。最后,我们将分析扩展到异步Q学习(即具有马尔可夫样本的情形),将其样本复杂度的 horizon( horizon,时间视野)依赖锐化为1(1γ)4\frac{1}{(1-\gamma)^4}

关键词

引用

@article{arxiv.2102.06548,
  title  = {Is Q-Learning Minimax Optimal? A Tight Sample Complexity Analysis},
  author = {Gen Li and Changxiao Cai and Yuxin Chen and Yuting Wei and Yuejie Chi},
  journal= {arXiv preprint arXiv:2102.06548},
  year   = {2025}
}

备注

accepted to Operations Research