中文

通过识别局部异常进行数据插补

机器学习 2014-10-02 v1 机器学习

摘要

我们在无模型设定下引入了一种全面且统计学的框架,用于完整处理由严重噪声源(例如视觉记录中的遮挡物)引起的局部数据损坏。在此框架内,我们提出了:i) 一种新算法,用于有效地从给定的可疑数据实例中分离(即检测并定位)可能的损坏;ii) 一个最大后验 (MAP) 估计器,用于对损坏数据进行插补。作为欧几里得距离的推广,我们还提出了一种新的距离度量,该度量基于数据属性间的排序偏差,并在经验上被证明在分离损坏方面更为优越。我们的算法首先通过数据属性空间中的二叉分割树将可疑实例划分为若干部分,并利用从未损坏(干净)参考数据集提取的标称统计量迭代测试这些部分以检测局部异常。一旦将每个部分标记为异常或正常,便识别出表征损坏的该树上的相应二进制模式,并对受影响的属性进行插补。在假设二进制模式具有特定条件独立结构的情况下,我们从分析上证明,所引入算法在检测损坏时的误报率与数据无关,可直接设定而无需任何参数调整。该框架在多个带有合成生成损坏的知名机器学习数据集上进行了测试;实验表明,凭借强大的损坏分离能力,其在分类任务中产生了显著的改进。我们的实验还指出,所提出的算法优于典型方法,并且对训练阶段条件的变化具有鲁棒性。

关键词

引用

@article{arxiv.1409.8576,
  title  = {Data Imputation through the Identification of Local Anomalies},
  author = {Huseyin Ozkan and Ozgun S. Pelvan and Suleyman S. Kozat},
  journal= {arXiv preprint arXiv:1409.8576},
  year   = {2014}
}