中文

基于最小假设条件的时变策略 Q 学习分析

机器学习 2026-04-07 v2 最优化与控制 机器学习

摘要

本文首次对时变学习策略 (即按策略采样) 的 Q 学习进行有限时程分析,适用于折扣马尔可夫决策过程,且仅需最小假设,即存在一种能使状态空间形成不可约马尔可夫链的策略。我们建立了关于 E[QkQ2]\mathbb{E}[\|Q_k - Q^*\|_\infty^2] 的最后收敛速率,从而推导出实现 E[QkQ]ξ\mathbb{E}[\|Q_k - Q^*\|_\infty]\le \xi 所需的样本复杂度为 O(1/ξ2)\mathcal{O}(1/\xi^2)。这与 off-policy Q 学习的收敛速率一致,但对探索相关参数的依赖较大。我们还推导了关于 E[QπkQ2]\mathbb{E}[\|Q^{\pi_k} - Q^*\|_\infty^2] 的有限时程速率,其中 πk\pi_k 是第 k 次迭代的学习策略,突出了按策略 Q 学习中探索-利用权衡的关键问题。虽然探索强度不如 off-policy 方法,但按策略学习因学习策略收敛至最优策略而具有利用优势。数值实验支持了我们的理论。技术上,快速时变的学习策略导致马尔可夫噪声呈时非齐次性,这在最小探索条件下带来显著分析挑战。为此,我们发展了基于泊松方程的分解方法,对时非齐次马尔可夫噪声进行分解,将其划分为鞅差项和残差项。通过对泊松方程解相对于 Q 函数估计和学习策略的灵敏度进行分析,可控制残差项。这些技术可能推广至其他具有时变策略的强化学习算法,如单时间尺度 actor-critic 方法和学习型博弈算法。

关键词

引用

@article{arxiv.2510.16132,
  title  = {A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies},
  author = {Phalguni Nanda and Zaiwei Chen},
  journal= {arXiv preprint arXiv:2510.16132},
  year   = {2026}
}

备注

46 pages, 4 figures