中文

Sever:一种用于随机优化的鲁棒元算法

机器学习 2019-05-31 v2 人工智能 数据结构与算法 机器学习

摘要

在高维空间中,大多数机器学习方法即使面对极小比例的结构化异常值也会变得脆弱。为此,我们引入了一种新的元算法,该算法可以接收一个基础学习器(如最小二乘或随机梯度下降),并强化该学习器以抵抗异常值。我们的方法 Sever 具有强有力的理论保证,同时也具有高度可扩展性——除运行基础学习器本身外,它仅需计算某个 n×dn \times d 矩阵的顶部奇异向量。我们将 Sever 应用于一个药物设计数据集和一个垃圾邮件分类数据集,发现在这两种情况下它都比几个基线方法具有显著更强的鲁棒性。在垃圾邮件数据集上,有 1%1\% 污染时,我们取得了 7.4%7.4\% 的测试误差,而基线方法为 13.4%20.5%13.4\%-20.5\%,在无污染数据集上为 3%3\% 误差。类似地,在药物设计数据集上,有 10%10\% 污染时,我们取得了 1.421.42 的均方误差测试误差,而基线方法为 1.511.51-2.332.33,在无污染数据集上为 1.231.23 误差。

关键词

引用

@article{arxiv.1803.02815,
  title  = {Sever: A Robust Meta-Algorithm for Stochastic Optimization},
  author = {Ilias Diakonikolas and Gautam Kamath and Daniel M. Kane and Jerry Li and Jacob Steinhardt and Alistair Stewart},
  journal= {arXiv preprint arXiv:1803.02815},
  year   = {2019}
}

备注

To appear in ICML 2019