当不知情异常值淹没数据时的相合回归
机器学习
2021-05-26 v2 机器学习
摘要
我们考虑稳健线性回归模型 y=Xβ* + η,其中对设计矩阵 X∈R^{n×d} 不知情的对手可选择 η 以任意方式破坏除 α 比例以外的所有观测 y。在我们工作之前,即便对于高斯 X,该模型中除二次样本量 n≳(d/α)^2 或对数内点比例 α≥1/log n 外,尚无已知的 β* 估计量是相合的。我们证明相合估计在近乎线性的样本量与反多项式的内点比例下是可能的。具体而言,我们证明 Huber 损失估计量对每个样本量 n=ω(d/α^2) 都是相合的,并达到 O(d/α^2n)^{1/2} 的误差率。两个界均为最优(至多差常数因子)。我们的结果推广到远超高斯情形的设计,仅要求 X 的列空间不包含近似稀疏向量(类似于压缩感知中关于核空间通常所做的假设)。我们给出两个技术上相似的证明。一个证明以强凸性表述,推广了 [Tsakonas et al.'14] 的工作,且特别简短。另一个证明揭示了 Huber 损失估计量与高维中位数计算之间的联系。在高斯设计这一特例中,该联系引导我们得到一种基于计算坐标中位数、在近乎线性时间内达到最优保证且能利用 β* 稀疏性的极简算法。此处研究的模型也涵盖了可能甚至不存在一阶矩的重尾噪声分布。
引用
@article{arxiv.2009.14774,
title = {Consistent regression when oblivious outliers overwhelm},
author = {Tommaso d'Orsi and Gleb Novikov and David Steurer},
journal= {arXiv preprint arXiv:2009.14774},
year = {2021}
}
备注
To appear in ICML 2021