基于硬阈值的鲁棒回归
机器学习
2015-06-09 v1 机器学习
摘要
我们研究鲁棒最小二乘回归(RLSR)问题,其中若干响应变量可能被对抗性地损坏。更具体地,对于数据矩阵 X \in R^{p x n} 和底层模型 w*,响应向量生成为 y = X'w* + b,其中 b \in R^n 是损坏向量,其支撑至多位于 C.n 个坐标上。现有的 RLSR 精确恢复结果仅关注基于 L1 惩罚的凸公式,并施加相对严格的模型假设,例如要求损坏向量 b 独立于 X 选取。本工作中,我们研究一种称为 TORRENT 的简单硬阈值算法,该算法在 X 的温和条件下,即使 b 以对抗方式损坏响应变量(即 b 的支撑和元素均在观测到 X 和 w* 后对抗性地选取)也能精确恢复 w*。我们的结果在确定性假设下成立,这些假设在 X 从任意次高斯分布中采样时得到满足。最后,与仅适用于独立于 X 生成的固定 w* 的现有结果不同,我们的结果是普适的,并对任意 w* \in R^p 成立。接下来,我们提出基于梯度下降的 TORRENT 扩展,可高效扩展到大规模问题,例如高维稀疏恢复,并证明这些扩展具有类似的恢复保证。经验上,我们发现 TORRENT 及其扩展比最先进的 L1 求解器恢复速度快得多,尤其是其扩展。例如,即使在中等规模数据集(p = 50K)上约有 40% 的响应被损坏,我们提出的方法的一个变体 TORRENT-HYB 也比最佳 L1 求解器快 20 倍以上。
引用
@article{arxiv.1506.02428,
title = {Robust Regression via Hard Thresholding},
author = {Kush Bhatia and Prateek Jain and Purushottam Kar},
journal= {arXiv preprint arXiv:1506.02428},
year = {2015}
}
备注
24 pages, 3 figures