中文

线性模型中关于良性过拟合的分布外泛化

机器学习 2024-12-20 v1 机器学习

摘要

良性过拟合指的是过参数化模型在训练数据上完美拟合(包括数据中的噪声),但仍能对未见的测试数据有效泛化的现象。虽然已有研究在分布内情景下对该现象提供了一些理论理解,但现代机器学习往往 operates in a more challenging Out-of-Distribution (OOD) regime,即目标(测试)分布可能与源(训练)分布截然不同。本文聚焦于分布外情景下的良性过拟合,特别关注过参数化线性模型在协变量迁移(covariate shift)下的基本设置。我们提供了非渐近界,证明即使在分布外情景下,标准岭回归(ridge regression)仍可实现良性过拟合,前提是目标协方差矩阵满足特定结构条件。我们识别了若干与源协方差和目标协方差相关的关键量,这些量决定了分布外泛化性能。我们的结果尖锐,可严格恢复先前分布内良性过拟合保证[Tsigler and Bartlett, 2023],以及在参数化不足时分布外保证[Ge et al., 2024]。此外,我们还针对更一般的目标协方差矩阵族,给出理论结果:标准岭回归仅达到 O(1/n)O(1/\sqrt{n}) 的慢统计收敛率,而主成分回归(PCR)可保证达到 O(1/n)O(1/n) 的快收敛率,其中 nn 为样本数。

关键词

引用

@article{arxiv.2412.14474,
  title  = {Benign Overfitting in Out-of-Distribution Generalization of Linear Models},
  author = {Shange Tang and Jiayun Wu and Jianqing Fan and Chi Jin},
  journal= {arXiv preprint arXiv:2412.14474},
  year   = {2024}
}

备注

58 pages, 1 figure