降低有害实例的影响
机器学习
2014-10-16 v2 机器学习
摘要
数据集中并非所有实例对归纳数据模型都同等有益。某些实例(如离群点或噪声)可能是有害的。然而,至少在初始阶段,机器学习算法通常将数据集中的实例视为同等重要。当前许多处理噪声和有害实例的方法对实例是否有害做出二元判定。在本文中,我们1)通过在连续尺度上对实例进行加权来扩展这一范式,并2)提出一种度量实例对归纳数据模型可能有多大危害的方法。我们将这种识别并对有害实例加权的方法称为降低有害实例学习(RDIL)。我们在54个数据集和5种学习算法上检验了RDIL,并将其与其他加权与过滤方法进行了比较。RDIL 对于每个实例都能影响分类边界且训练实例被单独考虑的学习算法尤为有效,例如通过反向传播训练的多层感知机(MLP)。我们的结果还表明,更准确地估计哪些实例是有害的,能对处理这些实例产生显著的积极影响。
引用
@article{arxiv.1406.2237,
title = {Reducing the Effects of Detrimental Instances},
author = {Michael R. Smith and Tony Martinez},
journal= {arXiv preprint arXiv:1406.2237},
year = {2014}
}
备注
6 pages, 5 tables, 2 figures. arXiv admin note: substantial text overlap with arXiv:1403.1893