Q学习是极小极大最优的吗?一个紧致的样本复杂度分析
机器学习
2025-03-18 v4 信息论
机器学习
math.IT
最优化与控制
统计理论
统计理论
摘要
Q学习以无模型方式寻求学习马尔可夫决策过程(MDP)的最优Q函数,位于强化学习的核心。在同步设定下(即每次迭代中从生成模型抽取所有状态-动作对的独立样本),理解Q学习的样本效率已取得实质性进展。考虑一个具有状态空间和动作空间的-折扣无限 horizon(无限期)MDP:为获得最优Q函数的逐项近似,Q学习的当前最优理论要求样本量超过阶,未能匹配现有的极小极大下界。这引出了自然的问题:Q学习的精确样本复杂度是什么?Q学习是否被证明是次优的?本文针对同步设定解决这些问题:(1)当时(此时Q学习退化为TD学习),我们证明TD学习的样本复杂度是极小极大最优的,且按缩放(至多差对数因子);(2)当时,我们确定Q学习的样本复杂度阶为(至多差对数因子)。我们的理论揭示了当时Q学习的严格次优性,并严谨化了Q学习中过高估计的负面影响。最后,我们将分析扩展到异步Q学习(即具有马尔可夫样本的情形),将其样本复杂度的 horizon( horizon,时间视野)依赖锐化为。
引用
@article{arxiv.2102.06548,
title = {Is Q-Learning Minimax Optimal? A Tight Sample Complexity Analysis},
author = {Gen Li and Changxiao Cai and Yuxin Chen and Yuting Wei and Yuejie Chi},
journal= {arXiv preprint arXiv:2102.06548},
year = {2025}
}
备注
accepted to Operations Research