中文

关于过参数化线性回归和对角线性网络下 $\ell_p$ 偏置的 $\ell_r$ 范数缩放

机器学习 2026-03-20 v4 统计理论 机器学习 统计理论

摘要

对于具有各向同性高斯设计且满足 minimum-p\ell_p 插值(p(1,2]p\in(1,2])的过参数化线性回归,我们给出对参数范数家族 {wp^r}r[1,p]\{ \lVert \widehat{w_p} \rVert_r \}_{r \in [1,p]} 随样本量缩放的统一高概率特征。我们通过简单的数 dual-ray 分析解决了这一基本问题,揭示了信号*尖峰*与 *bulk* 中零坐标在 XYX^\top Y 之间的竞争,从而给出闭式预测:(i)数据依赖的转移 nn_\star ("肩部"),(ii)普适阈值 r=2(p1)r_\star=2(p-1) 划分 wp^r\lVert \widehat{w_p} \rVert_r 的平缓区与持续增长区及其显式指数。这种统一解解决了在p\ell_p偏置下 r[1,p]r\in [1,p] 范围内所有r\ell_r 范数的缩放问题,并用一幅图解释了哪些范数随 nn 增长而饱和,哪些范数则持续增长。随后我们研究对角线性网络(DLN),通过将初始化尺度 α\alpha校准为有效 peff(α)p_{\mathrm{eff}}(\alpha) 以DLN可分离势,发现 DLN 继承相同的肩部/阈值规律,为显式偏置与隐式偏置之间提供了预测桥梁。鉴于许多泛化代理依赖于 wp^r\lVert \widehat{w_p} \rVert_r,我们的结果表明其预测能力严格取决于所采用的 r\ell_r 范。

关键词

引用

@article{arxiv.2509.21181,
  title  = {Closed-form $\ell_r$ norm scaling with data for overparameterized linear regression and diagonal linear networks under $\ell_p$ bias},
  author = {Shuofeng Zhang and Ard Louis},
  journal= {arXiv preprint arXiv:2509.21181},
  year   = {2026}
}