中文

依赖学习理论中的锐速:避免平方损失的样本量缩减

机器学习 2025-04-02 v4 机器学习

摘要

在这项工作中,我们研究了在假设类 FLΨp\mathscr{F}\subset L_{\Psi_p} 中使用依赖(β\beta-混合)数据和平方损失的统计学习,其中 Ψp\Psi_p 是范数 fΨpsupm1m1/pfLm\|f\|_{\Psi_p} \triangleq \sup_{m\geq 1} m^{-1/p} \|f\|_{L^m} ,对于某个 p[2,]p\in [2,\infty]。我们的探究动机是在依赖数据的学习中寻找锐利的噪声交互项,或方差代理。在没有任何可实现性假设的情况下,典型的非渐近结果表现出方差代理被底层协变量过程的混合时间乘法性地缩减。我们证明,只要 L2L^2Ψp\Psi_p 的拓扑在我们的假设类 F\mathscr{F} 上是可比的——也就是说,F\mathscr{F} 是一个弱次高斯类:对于某个 η(0,1]\eta\in (0,1]fΨpfL2η\|f\|_{\Psi_p} \lesssim \|f\|_{L^2}^\eta——经验风险最小化器就能达到一个其主导项仅依赖于该类的复杂度和二阶统计量的速率。我们的结果无论问题是否可实现都成立,我们将其称为“近似无混合速率”,因为对混合的直接依赖被降级为加性的高阶项。我们通过将上述弱次高斯类的概念与混合尾通用链相结合,得出了我们的结果。这种结合使我们能够为广泛的问题计算锐利的、实例最优的速率。满足我们框架的例子包括次高斯线性回归、更一般的平滑参数化函数类、有限假设类和有界光滑类。

关键词

引用

@article{arxiv.2402.05928,
  title  = {Sharp Rates in Dependent Learning Theory: Avoiding Sample Size Deflation for the Square Loss},
  author = {Ingvar Ziemann and Stephen Tu and George J. Pappas and Nikolai Matni},
  journal= {arXiv preprint arXiv:2402.05928},
  year   = {2025}
}