中文

Q学习符号分离有限时误差分析

人工智能 2026-05-18 v1

摘要

本文发展了关于常数步长Q学习的符号分离有限时误差分析。从开关系统表示开始,将误差分解为其分量级的负部分和正部分。负部分由与固定最优策略相关联的下界比较线性时不变(LTI)系统所主导,而正部分则由线性开关系统所控制。所得界表明,负侧LTI证书的速度不慢于正侧开关证书,可能产生更快的指数包络。该分析识别了Q学习误差动力学中的最大引发的非对称性。该非对称性与超估计相关联:正的动作级误差可被贝尔曼最大运算选中并传递,而负误差则容许最优策略下界比较。在给定确定性和随机常数步长递归中,提供有限时界。

关键词

引用

@article{arxiv.2605.16103,
  title  = {Sign-Separated Finite-Time Error Analysis of Q-Learning},
  author = {Donghwan Lee},
  journal= {arXiv preprint arXiv:2605.16103},
  year   = {2026}
}