谱算法在大维数下的学习曲线与良性过拟合
机器学习
2026-04-28 v1 机器学习
统计理论
统计理论
摘要
现有的大维数理论只分别解析最优调谐点或插值极限,未涵盖未正则化的区间。我们研究谱算法在样本量与维数同阶 (, ) 的大维数情形下的学习曲线与良性过拟合现象。首先我们考察球面 上的内积核,给出在各种源条件 下( 衡量回归函数的相对光滑性)正则化路径上剩余风险的尖锐渐近特征。我们的结果表明,学习曲线并非简单U型,而是包含三个明确区间:过正则化、未正则化与插值区间。这种特征化使我们能够完全捕获良性过拟合现象,表明只要 为正且不超过临界阈值,良性过拟合在未正则化与插值区间均会持续发生。我们进一步证明,在足够正则化的区间,核学习曲线可由关联序列模型恢复。最后,我们将学习曲线分析推广至满足谱比例与超收敛条件的一般域 上的大维数 KRR。
引用
@article{arxiv.2604.23212,
title = {Learning Curves and Benign Overfitting of Spectral Algorithms in Large Dimensions},
author = {Weihao Lu and Qian Lin and Yingcun Xia and Dongming Huang},
journal= {arXiv preprint arXiv:2604.23212},
year = {2026}
}