高维线性因子混合分类中高斯普适性的失效
机器学习
2025-03-14 v3 机器学习
统计理论
统计理论
摘要
高斯或高斯混合数据的假设已被广泛用于一系列机器学习(ML)方法的精确性能分析中,这些分析针对的是样本和特征数量相当的大规模数据集。为了放宽这一限制性假设,后续工作致力于通过研究高斯普适性场景来建立“高斯等效原理”,在这些场景中,当非高斯数据被替换为具有相同均值和协方差的高斯数据时,ML方法在该数据上的渐近性能保持不变。在高斯普适性领域之外,关于数据分布如何影响学习性能的精确结果很少。在本文中,我们针对线性因子模型的一般混合数据设置下的分类问题,提供了经验风险最小化的精确高维刻画,该设置扩展了高斯混合。在此设置下,高斯普适性被证明失效,其意义在于渐近学习性能依赖于超出类均值和协方差的数据分布。为了阐明高斯普适性在混合数据分类中的局限性并理解其失效的影响,我们指定了高斯普适性的条件,并讨论了它们对损失函数选择的意义。
引用
@article{arxiv.2410.05609,
title = {The Breakdown of Gaussian Universality in Classification of High-dimensional Linear Factor Mixtures},
author = {Xiaoyi Mai and Zhenyu Liao},
journal= {arXiv preprint arXiv:2410.05609},
year = {2025}
}
备注
34 pages, 10 figures, accepted by ICLR 2025 (https://openreview.net/forum?id=UrKbn51HjA)