中文

边缘化受损特征

机器学习 2014-02-28 v1

摘要

机器学习的目标是开发能良好泛化至测试数据的预测器。理想情况下,这是通过在几乎无限大的训练数据集上进行训练来实现的,该数据集捕捉了数据分布中的所有变化。然而,在实际学习设置中,我们没有无限的数据,我们的预测器可能会过拟合。对抗过拟合的方法例如可以向训练目标添加正则化项,或定义模型参数的先验并执行贝叶斯推断。在本文中,我们提出了第三种对抗过拟合的替代方法:我们通过损坏原始训练数据获得无限多的人工训练样本来扩展训练集。我们表明,这种方法对于一系列预测器和损坏模型而言是实用且高效的。我们的方法称为边缘化受损特征(MCF),通过在损坏模型下最小化损失函数的期望值来训练鲁棒的预测器。我们在各种数据集上的实证研究表明,MCF 分类器可以被高效训练,可能更好地泛化到测试数据,并且在测试时对特征删除也更鲁棒。

关键词

引用

@article{arxiv.1402.7001,
  title  = {Marginalizing Corrupted Features},
  author = {Laurens van der Maaten and Minmin Chen and Stephen Tyree and Kilian Weinberger},
  journal= {arXiv preprint arXiv:1402.7001},
  year   = {2014}
}