基于中位数均值法的鲁棒机器学习:理论与实务
统计理论
2017-12-04 v2 统计理论
摘要
我们基于实值随机变量均值的中位数均值法(MOM)估计量,引入用于鲁棒机器学习的新估计量。这些估计量在数据集的最小假设下达到最优收敛速率。数据集也可能被异常值污染,而对异常值不作任何假设。我们还用鲁棒统计的标准工具分析这些新估计量。特别地,我们重访了崩溃点的概念。我们修改原始定义,研究数据集在不损害给定估计量估计性质前提下可包含的异常值数量。这种考虑估计量统计性能的新崩溃数概念具有非渐近本质,并适于机器学习用途。我们证明我们估计量的崩溃数量级为(观测数)×(收敛速率)。例如,对于具有噪声方差sigma^2的d维向量估计问题,我们的估计量崩溃数为sigma^2d;当该向量仅有s个非零分量时,变为sigma^2 s log(d/s)。超越此崩溃点,我们证明估计量达到的收敛速率为(异常值数)除以(观测数)。除这些理论保证外,这些新估计量的主要改进在于它们易于在实践中计算。事实上,基本上任何用于逼近标准经验风险最小化器(或其正则化版本)的算法都有逼近我们估计量的鲁棒版本。作为概念验证,我们研究了经典LASSO估计量的多种算法。MOM算法的一个副产品是可用来检测异常值的数据深度度量。
引用
@article{arxiv.1711.10306,
title = {Robust machine learning by median-of-means : theory and practice},
author = {Guillaume Lecué and Matthieu Lerasle},
journal= {arXiv preprint arXiv:1711.10306},
year = {2017}
}
备注
48 pages, 6 figures