中文

无参数最优收敛率:非半范数收缩问题及其在 Q-学习中的应用

机器学习 2026-03-24 v2

摘要

求解非线性固定点方程(如平均奖励 Q-学习和 TD 学习)的算法常涉及半范数收缩。通过 Polyak--Ruppert 平均方法实现这些方法的参数自由最优收敛率长期以来由于半范数非单调性而尚未实现。我们通过 (i) 将平均误差重构为包含非线性扰动的线性递推,以及 (ii) 通过将半范数的收缩与 suitably 诱导范数的单调性进行耦合来控制非线性,来弥合这一差距。我们的主要结果给出了首个在平均奖励和指数折扣设置下实现参数自由 O~(1/t)\tilde{O}(1/\sqrt{t}) 最优收敛率的结果,其中 tt 表示迭代指数。该结果适用于一个广泛的框架,可容纳同步和异步更新、单代理和分布式部署,以及来自模拟器或马尔可夫轨迹的数据流。

关键词

引用

@article{arxiv.2508.05984,
  title  = {Parameter-free Optimal Rates for Nonlinear Semi-Norm Contractions with Applications to $Q$-Learning},
  author = {Ankur Naskar and Gugan Thoppe and Vijay Gupta},
  journal= {arXiv preprint arXiv:2508.05984},
  year   = {2026}
}