中文

谱算法在大维数下的学习曲线与良性过拟合

机器学习 2026-04-28 v1 机器学习 统计理论 统计理论

摘要

现有的大维数理论只分别解析最优调谐点或插值极限,未涵盖未正则化的区间。我们研究谱算法在样本量与维数同阶 (ndγn \asymp d^{\gamma}, γ>0\gamma>0) 的大维数情形下的学习曲线与良性过拟合现象。首先我们考察球面 Sd1\mathbb{S}^{d-1} 上的内积核,给出在各种源条件 s0s \geq 0 下(ss 衡量回归函数的相对光滑性)正则化路径上剩余风险的尖锐渐近特征。我们的结果表明,学习曲线并非简单U型,而是包含三个明确区间:过正则化、未正则化与插值区间。这种特征化使我们能够完全捕获良性过拟合现象,表明只要 ss 为正且不超过临界阈值,良性过拟合在未正则化与插值区间均会持续发生。我们进一步证明,在足够正则化的区间,核学习曲线可由关联序列模型恢复。最后,我们将学习曲线分析推广至满足谱比例与超收敛条件的一般域 Rd\mathbb{R}^d 上的大维数 KRR。

关键词

引用

@article{arxiv.2604.23212,
  title  = {Learning Curves and Benign Overfitting of Spectral Algorithms in Large Dimensions},
  author = {Weihao Lu and Qian Lin and Yingcun Xia and Dongming Huang},
  journal= {arXiv preprint arXiv:2604.23212},
  year   = {2026}
}