基于参考-优势分解的Q学习的间隔依赖性界限
机器学习
2025-03-11 v2 机器学习
摘要
我们研究了两种用于有限时段表格型马尔可夫决策过程(MDPs)的基于策略的Q学习算法的间隔依赖性界限:UCB-优势(Zhang等2020)和Q-EarlySettled-优势(Li等2021)。UCB-优势和Q-EarlySettled-优势改进了基于Hoeffding型奖励的算法,实现了在总步数为T的情形下的近最优√T型 regret界限。然而,MDPs的良好结构(如严格正的次优间隔)可显著改善regret。虽然已为基于Hoeffding型奖励的Q学习获得了间隔依赖性regret界限,但仍是一个开放问题:如何为使用方差估计器及参考-优势分解进行方差缩减的Q学习建立间隔依赖性regret界限。我们发展了一种新型误差分解框架,以证明UCB-优势和Q-EarlySettled-优势的间隔依赖性regret界限,这些界限相对于现有的Q学习算法具有对T的对数级改进。此外,我们建立了UCB-优势的政策切换成本的间隔依赖性界限,并在最坏情况MDPs下改进了该界限。鉴于本文是首个为使用方差估计器和参考-优势分解的Q学习提供间隔依赖性regret分析,也是首个对Q学习的政策切换成本进行间隔依赖性分析,我们的工作具有重要意义。
引用
@article{arxiv.2410.07574,
title = {Gap-Dependent Bounds for Q-Learning using Reference-Advantage Decomposition},
author = {Zhong Zheng and Haochen Zhang and Lingzhou Xue},
journal= {arXiv preprint arXiv:2410.07574},
year = {2025}
}