中文

论数据异常的预测性解释

机器学习 2021-10-19 v1

摘要

已有大量算法被提出用于以无监督方式检测异常(离群点、新颖点)。然而,通常情况下,理解为什么给定样本(记录)被标记为异常并诊断其根本原因并非易事。我们提出以下降维代理模型方法来解释检测器的决策:用另一个仅使用少量特征子集的模型来近似检测模型。随后,样本可以在该低维空间中可视化以便人类理解。为此,我们开发了 PROTEUS,这是一种用于生成代理模型的 AutoML 流水线,专门针对不平衡数据集上的特征选择而设计。PROTEUS 代理模型不仅能解释训练数据,还能解释样本外(未见)数据。换言之,PROTEUS 通过近似无监督检测器的决策面来产生预测性解释。PROTEUS 旨在返回样本外预测性能的准确估计,以此作为近似质量的度量。计算实验证实了 PROTEUS 在为不同类别的检测器产生预测性解释方面的有效性,以及可靠估计其在未见数据上预测性能的能力。与几种临时特征重要性方法不同,PROTEUS 对高维数据具有鲁棒性。

关键词

引用

@article{arxiv.2110.09467,
  title  = {On Predictive Explanation of Data Anomalies},
  author = {Nikolaos Myrtakis and Ioannis Tsamardinos and Vassilis Christophides},
  journal= {arXiv preprint arXiv:2110.09467},
  year   = {2021}
}

备注

12 pages