高斯数据足矣吗?高维广义线性估计中普适性的范围与局限
统计理论
2023-02-20 v1 无序系统与神经网络
机器学习
机器学习
统计理论
摘要
在本稿件中,我们考虑了标签由单指标模型给出的高斯混合数据上的广义线性估计问题。我们的第一个结果是高维情形下测试误差与训练误差的精确渐近表达式。受近期关于广义线性估计中测试与训练误差高斯普适性的一系列结果启发,我们提出如下问题:“何时一个单一高斯分布足以刻画误差?”我们的公式使我们能够对此问题给出精确的回答,既有肯定方向也有否定方向。更确切地说,我们表明高斯普适性(或缺乏普适性)的充分条件关键取决于目标权重与混合簇的均值和协方差之间的对齐程度,我们对此进行了精确量化。在最小二乘插值的特殊情况下,我们证明了训练误差的强普适性性质,并表明其服从一个简单的闭式表达式。最后,我们将结果应用于真实数据集,澄清了文献中近期关于此背景下误差高斯普适性的某些讨论。
引用
@article{arxiv.2302.08923,
title = {Are Gaussian data all you need? Extents and limits of universality in high-dimensional generalized linear estimation},
author = {Luca Pesce and Florent Krzakala and Bruno Loureiro and Ludovic Stephan},
journal= {arXiv preprint arXiv:2302.08923},
year = {2023}
}