Q-Learning 的 Lyapunov 认证直接切换理论
机器学习
2026-05-06 v3 人工智能
系统与控制
系统与控制
摘要
Q-learning 是强化学习中基本的算法原语。本文开发了一个从切换系统视角分析 Q-learning 的新框架。特别地,我们推导了 Q-learning 误差的直接随机切换系统表示。关键观察是,在合适的随机策略下,Bellman 最大化误差可以精确表示为逐动作 Q-误差的平均值。由此产生的递推具有切换线性条件均值漂移和鞅差噪声。据我们所知,这是对标准 Q-learning 的首次收敛速率分析,其主导指数速率通过直接切换族的联合谱半径(JSR)来表达。由于 JSR 是相关联的切换线性漂移的精确最坏情况指数速率,因此所得速率是可以为该 Q-learning 表示认证的最紧密的基于漂移的速率之一。基于该表示,我们使用由乘积定义的 JSR 诱导的 Lyapunov 函数证明了有限时间界限,并给出了可选的公共二次 Lyapunov 证书。二次证书仅是充分条件,因此仅适用于该证书可行的实例,而只要其 JSR 低于 1,JSR 诱导的 Lyapunov 构造就适用于整个直接切换族。当可行时,二次证书用可计算的矩阵不等式代替基于乘积的验证,并给出更简单的随机界限。我们进一步将该框架扩展到马尔可夫观测模型。
引用
@article{arxiv.2604.19569,
title = {Lyapunov-Certified Direct Switching Theory for Q-Learning},
author = {Donghwan Lee},
journal= {arXiv preprint arXiv:2604.19569},
year = {2026}
}