中文

冻结策略迭代:线性Q策略可实现性下的高效强化学习算法

机器学习 2026-03-03 v1 机器学习

摘要

我们研究在线性Q策略可实现性假设下进行的计算和统计高效强化学习,该假设指任意策略的Q函数在给定状态-动作特征表示中均为线性。现有方法在此设置下要么计算不可行,要么需要(局部)模拟器访问。本文提出一种计算高效的在线强化学习算法,命名为冻结策略迭代(Frozen Policy Iteration),适用于线性Q策略可实现性设置下的马尔可夫决策过程(MDP),该MDP包含随机初始状态、随机奖励和确定性转移。我们的算法实现O~(d2H6T)\widetilde{O}(\sqrt{d^2H^6T})的 regret上界,其中d为特征空间维数,H为时隙长度,T为总回合数。我们的regret上界对于线性(情境)bandit问题是最优的,这是本设置下H=1的特殊情况。现有策略迭代算法在同一设置下严重依赖反复抽取相同状态的模拟器访问,这在本文研究的随机初始状态在线设置中无法实现。相反,我们的新算法通过战略性地仅使用轨迹数据的高置信区间部分并冻结对已探索状态的策略,从而确保学习过程中所用数据始终有效地保持在策略内。我们进一步通过扩展到Uniform-PAC设置以及具有有限eluder维度的函数类,展示了该方法的通用性。

关键词

引用

@article{arxiv.2603.00716,
  title  = {Frozen Policy Iteration: Computationally Efficient RL under Linear $Q^{\pi}$ Realizability for Deterministic Dynamics},
  author = {Yijing Ke and Zihan Zhang and Ruosong Wang},
  journal= {arXiv preprint arXiv:2603.00716},
  year   = {2026}
}