中文

经验风险最小化的普适性

统计理论 2022-11-01 v2 机器学习 机器学习 统计理论

摘要

考虑从 i.i.d. 样本 {xi,yi}in\{{\boldsymbol x}_i,y_i\}_{i\le n} 的监督学习,其中 xiRp{\boldsymbol x}_i \in\mathbb{R}^p 为特征向量,yR{y} \in \mathbb{R} 为标签。我们研究在一类由 k=O(1)\mathsf{k} = O(1) 个向量 θ1,...,θkRp{\boldsymbol \theta}_1, . . . , {\boldsymbol \theta}_{\mathsf k} \in \mathbb{R}^p 参数化的函数上的经验风险最小化,并证明训练误差与测试误差的普适性结果。即在比例渐近 n,pn,p\to\infty、且 n/p=Θ(1)n/p = \Theta(1) 下,我们证明训练误差仅通过随机特征分布的协方差结构依赖于该分布。进一步,我们证明在近经验风险最小化子集中最小测试误差享有类似的普适性性质。特别地,这些量的渐近行为可在更简单的模型中——将特征向量 xi{\boldsymbol x}_i 替换为具有相同协方差的高斯向量 gi{\boldsymbol g}_i——至主导阶被计算。早期的普适性结果局限于强凸学习过程,或局限于具有独立分量的特征向量 xi{\boldsymbol x}_i。我们的结果不作这些假设中的任何一个。我们的假设足够一般以包含由随机化特征映射生成的特征向量 xi{\boldsymbol x}_i。特别地,我们显式核验了某些随机特征模型(以随机权重计算单层神经网络输出)与神经正切模型(双层网络的一阶泰勒近似)的假设。

关键词

引用

@article{arxiv.2202.08832,
  title  = {Universality of empirical risk minimization},
  author = {Andrea Montanari and Basil Saeed},
  journal= {arXiv preprint arXiv:2202.08832},
  year   = {2022}
}

备注

74 pages